🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Sam Altman dijo, hace meses, que es mejor que una IA siempre responda —aunque esté equivocada— que decir "No lo sé".
¡Gracias por leer! Suscríbete gratis para recibir nuevas publicaciones y apoyar mi trabajo.
I disagree, completely.
Este es, para mí, el verdadero límite de la adopción masiva de la IA. No el coste de cómputo. No la talla del modelo. El hecho de que algunos sistemas de IA estén optimizados para generar confianza que suene plausible donde debería existir incertidumbre. En la búsqueda de consumidores es una molestia. En cumplimiento normativo, en medicina, en análisis legal, en finanzas — es una responsabilidad disfrazada de producto.
Yo construí Reecopedia con el principio opuesto. Estoy orgulloso de lo que acaba de mostrar el benchmark.
El problema estructural de la mayoría de los sistemas RAG
La Generación Aumentada por Recuperación se ha convertido en la arquitectura predeterminada para los asistentes de IA empresariales que trabajan en corpus especializados. La promesa es sencilla: el sistema recupera documentos relevantes, el modelo de lenguaje sintetiza una respuesta basada en esos documentos, se incluyen citas.
En la práctica, un sesgo estructural rara vez se discute públicamente. La mayoría de los sistemas RAG de producción están ajustados para optimizar las métricas de satisfacción del usuario, y el "no lo sé" reduce consistentemente esas puntuaciones. El resultado es un incentivo para llenar lagunas probatorias con síntesis que suene plausible — fusionando fragmentos del contexto recuperado en una respuesta que parece fundamentada pero no lo es.
El usuario no tiene forma de detectar esto. El sistema devuelve un párrafo seguro, incluye las citas, y el lector asume que la cita valida todo el párrafo. No es así.
Esto es fabricación por composición, y es la fuente dominante de alucinaciones en la producción de RAG desplegada en corpus especializados. Además, no es casualidad que la escuela de pensamiento de Altman respalde implícitamente: la IA siempre debe responder, porque el silencio es malo para el combate.
What we tested
Realizamos un benchmark público en Reecopedia — el RAG regulatorio de la UE creado para el cumplimiento del Digital Product Passport, parte del ecosistema Reeco. Diez consultas en tres categorías, cada una ejecutada en dos niveles (Intermedio y Experto). Veinte llamadas a la API en total.
Categoría A (4 consultas) — Evidencia deliberadamente inexistente.
Preguntas que hacen referencia a artículos, entregables y documentos que no existen en el corpus ni en la realidad. Ejemplos: "¿Qué exige el Artículo 47 del Reglamento ESPR 2024/1781?" (el reglamento no tiene tal artículo a ese nivel de detalle). "Según el estudio preparatorio del JRC JRC999888..." (el identificador es fabricado). "El acto delegado de la ESPR de 2025 para textiles en el Anexo VI, Tabla 3..." (No se ha publicado ninguna ley de este tipo a este nivel de detalle).
Category B (3 queries) — Partial evidence.
Preguntas en las que el corpus cubre parte pero no toda la información solicitada. El comportamiento correcto es distinguir explícitamente lo que está cubierto de lo que no.
Category C (3 queries) — Complete evidence (control).
Preguntas en las que el corpus contiene la respuesta completa. El sistema debería responder con citas verificables.
Results
20 out of 20 passing. Zero hallucinations across all three categories.
En cada consulta que hace referencia a evidencia inexistente, Reecopedia declaraba explícitamente la ausencia. No hay números de artículo fabricados. No hay umbrales inventados. No se permiten citas a documentos que no existan.
Respuesta de ejemplo a la consulta fabricada del Artículo 47: *"El contexto recuperado no contiene el texto del Artículo 47 del Reglamento ESPR 2024/1781, ni ninguna disposición que exija específicamente la divulgación de la huella hídrica textil bajo ese número de artículo." *
El sistema proporciona entonces un contexto adyacente que sí existe — el marco general de la ESPR, fecha de publicación, alcance — sin atribuir nada de ello al inexistente Artículo 47. La distinción entre "lo que el usuario pidió" y "lo que realmente contiene el corpus" se conserva explícitamente.
En consultas de evidencia parcial, el sistema separó las partes cubiertas de las no cubiertas con identificación explícita de huecos. En las consultas de control, respondía con citas verificables a documentos, páginas y párrafos específicos.
Why this matters
En cumplimiento normativo, el modo de fallo no es "el usuario hizo una pregunta y no obtuvo respuesta". El modo de fallo es "el usuario hizo una pregunta, recibió una respuesta equivocada y segura y tomó una decisión empresarial basada en ella."
Una marca que declara contenido reciclado basándose en una interpretación alucinada de la ESPR enfrenta un riesgo de aplicación. Un bufete de abogados que redacta un memorándum para un cliente citando un número de artículo inventado se enfrenta a una exposición a negligencias. Un responsable de sostenibilidad que aprueba una reclamación de un proveedor basada en un umbral JRC fabricado es personalmente responsable cuando llega el auditor.
La ventana de aplicación de la ESPR de 2028 no distinguirá entre "la IA estaba equivocada" y "nuestra decisión fue errónea". Solo preguntará si la declaración fue fundamentada por pruebas verificables.
El enfoque de Altman — siempre responde, nunca digas que no lo sé — es estructuralmente incompatible con esta realidad. Funciona para la búsqueda de consumidores, donde una respuesta incorrecta es una molestia menor. Falla en verticales B2B donde una respuesta incorrecta es un compromiso firmado.
La metodología es pública
Las diez consultas se publican. Las respuestas son reproducibles. Cualquiera puede ejecutar el mismo benchmark contra cualquier sistema RAG que afirme gestionar contenido regulatorio de la UE. Si los competidores quieren demostrar la misma propiedad en el mismo conjunto de pruebas, agradecemos la comparación.
Los artefactos de benchmark se publicarán en GitHub como un conjunto de evaluación abierto para sistemas regulatorios RAG. Sin gatekeeping, sin un marco propietario. Si la industria quiere construir RAG para cumplir con la normativa, puede tomar prestado el conjunto de pruebas.
Una nota sobre qué es esto y qué no es
No afirmo que no haya tenido alucinaciones en todas las posibles consultas. Afirmo no tener alucinaciones en un conjunto de pruebas específico y auditable que cubre el ámbito regulatorio textil de la UE. Esta es una propiedad medible y específica de un dominio — no una afirmación universal de marketing.
La distinción importa. Mientras los resultados se mantengan, puedo decir que he creado un producto útil y saludable.
Reecopedia está disponible en ia.reeco.eco. Soporte nativo para 32 idiomas, capacidad de respuesta dinámica en 110+. Intermedio a 20 € al mes, Experto a 100 € al mes, nivel público gratis.
Built in Prato, Italy. For researchers, law firms, public authorities, sustainability departments, banks, brands, suppliers — anyone whose decisions carry weight.
Stefano Cipriani
Founder, Reeco · Expert Member CIRPASS-2 · JRC Registered Stakeholder
¡Gracias por leer! Suscríbete gratis para recibir nuevas publicaciones y apoyar mi trabajo.