🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: Revisión arquitectónica asistida por IA (inspección del código fuente, pruebas adversariales en vivo, comparación con benchmarks de recuperación publicados en 2026). Divulgación: esta evaluación se realizó con Claude (Anthropic) operando sobre acceso directo al código e interacción en el sistema en vivo; No se ejecutó ningún conjunto formal de benchmarks durante la evaluación en sí. Cada afirmación a continuación está anclada a un artefacto verificable: un archivo, un rango de líneas, una respuesta en tiempo real o una referencia publicada.


La tesis, enunciada para que pueda ser refutada

Un sistema de un único fundador construido en Prato, Italia, implementa una arquitectura de recuperación que iguala o supera la línea base de producción documentada para 2026 para RAG empresarial en seis de las ocho dimensiones medibles, y lo hace en un ámbito (regulación del Pasaporte Digital de Producto Textil de la UE) donde ningún sistema comercial de propósito general tiene una profundidad de corpus comparable.

La prueba para falsificarla: nombrar un producto comercial RAG que (a) se niegue a responder preguntas sobre artículos regulatorios que no existen, (b) cite fuentes con granularidad en secciones de archivo, incluyendo identificadores de contribuciones institucionales, y (c) ejecute recuperación híbrida densa+dispersa con pesos RRF ajustables en vivo — simultáneamente. El autor de esta evaluación no encontró ninguno. Un solo contraejemplo desmiente la afirmación. No se sabe ninguno.


The three engines

Engine 1 — RAG1 (Portal, FAISS). Un índice FAISS con espacio aéreo que sirve al portal de cadena de suministro de Reeco. Deliberadamente fuera de línea en el VPS: la decisión de diseño es aislamiento de seguridad, no limitación técnica. Nota honesta de alcance: RAG1 no fue evaluado directamente en esta evaluación; se describe arquitectónicamente.

Engine 2 — RAG2 (Reecopedia, production). Un oleoducto respaldado por Qdrant sobre un corpus regulatorio del Pacto Verde de la UE (materiales ESPR, ECGT, CSRD, CIRPASS-2, documentos de trabajo estándar EN; 47.996 puntos indexados en la colección de producción). Este es el motor que se probó en vivo.

Motor 3 — Capa de investigación y evaluación de recuperación. Un motor de interacción tardía ColBERT v2 indexado por separado más un arnés de evaluación: métricas RAGAS, conjuntos de prueba dorados, protocolos LLM-as-judge y comparaciones versionadas A/B (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). La recuperación contextual — el patrón de aumento de fragmentos publicado por Anthropic en 2024 — se implementa en la ingestión (contextual_retrieval.py).

Una metodología de investigación de este tipo — conjuntos de oro, modelos de juez, versiones A/B — es práctica habitual dentro de equipos de ML de veinte personas. No es una práctica habitual para un sistema construido por una sola persona.


La tubería de diez fases es la arquitectura, no el marketing

RAG2 ejecuta una tubería documentada de diez fases por consulta: configuración basada en auditoría por rol (cinco niveles de acceso, configuración servida por auditoría primero con respaldo en el entorno y caché de 60 segundos); planificación de consultas que produce reformulaciones retroactivas, subconsultas, palabras clave y texto HyDE; incrustación múltiple de hasta seis variantes de consulta, incluyendo un puente italiano a inglés; filtrado condicional de metadatos con alcance de documentos y reintento automático sin filtro; multi-recuperación con fusión de Rango Recíproco y reconstrucción de tablas (±10 fragmentos adyacentes, con alcance documental); enrutamiento de intención de tabla (mezcla 60/40 de tabla a texto cuando el clasificador detecta intención tabular); reclasificación con cuatro backends conmutables (cross-encoder, NLI/DeBERTa, Jina v3, determinista); compresión contextual limitada por rol; monitorización de puntuación con avisos de deriva que señalan la reingestión; y postprocesado que normaliza citas y extrae tablas y figuras como salida estructurada.

La mayoría de los sistemas comerciales exponen tres fases: ingerir, recuperar y generar. La diferencia no es estética: cada fase adicional es un modo de fallo gestionado.

Hybrid retrieval: live, governed, collection-aware

La recuperación híbrida Dense+BM25 — la configuración que los benchmarks publicados de 2026 identifican como la línea base de producción, valorada en +5–15% nDCG en corpus legal y técnico (BEIR/MIRACL) — está implementada y activa en rag2_service.py: vectores densos y dispersos nombrados en Qdrant, los pesos de prelectura RRF configurables en tiempo de ejecución mediante el panel de auditoría (por defecto 0,7 denso / 0,3 escaso), un interruptor de apagado a nivel de auditoría (hybrid_search_enabled), y una comprobación de capacidad por colección que se degrada elegantemente a solo densidad cuando una colección no tiene vectores dispersos. Los comentarios de la fuente citan a BEIR y MIRACL por nombre. Este no es un sistema que descubrió la recuperación híbrida a partir de un tutorial.

La prueba adversarial: el motor rechazó un artículo fabricado

Prueba en vivo, nivel Superadmin, 9 de junio de 2026. La consulta pedía "el umbral exacto del contenido reciclado según el artículo 7 del acto delegado de la ESPR para textiles" — una premisa deliberadamente fabricada: el acto delegado textil no está finalizado y no existe tal umbral.

La respuesta de la locomotora, literalmente en su pasaje crítico: “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” Luego se centró en lo que el corpus confirma — el Artículo 5(3) de la ESPR como base legal real para los requisitos de ecodiseño — con una cita en la granularidad de la tabla de páginas de archivo (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).

Un envoltorio de LLM de uso general, al que se le haga la misma pregunta, producirá lo más plausible posible un porcentaje. Los umbrales estadísticamente plausibles son exactamente lo que generan los modelos de lenguaje cuando no están restringidos. En un ámbito de cumplimiento, una respuesta incorrecta y segura no es una respuesta degradada, sino un evento de responsabilidad. El rechazo es el producto.

Este comportamiento es coherente con el referente públicamente documentado (rechazo 20/20 sobre un conjunto adversarial de tres categorías: disposiciones inexistentes, premisas de verdad parcial, controles), publicado con metodología en stefanocipri.substack.com ("The RAG that says I don't know", abril de 2026), donde se denomina el modo de fallo al que apunta: fabricación-por-composición.

Findings by dimension

DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time

Honestidad metodológica sobre esta tabla: las posiciones percentiales son estimaciones cualitativas producidas al comparar la arquitectura inspeccionada con descripciones de sistemas publicadas en 2026 (informes híbridos como línea base; publicaciones agentic-RAG con tasa de victoria en el rango del 64–76% frente a asistentes generales en corpora empresariales; comparaciones de precisión de recuperación del marco en la banda del 85–92%). No son el resultado de una prueba directa directa. El arnés RAGAS en repositorio hace que esta ejecución sea ejecutable y publicable; Hasta que se publique, la tabla anterior es una evaluación experta, no una medición.

Lo que la pila aún no tiene

Tres huecos, dicho sin rodeos. Primero, indexación incremental: la colección de fragmentos tardíos de Jina se puela por escritura por lotes, no bajo demanda; Los nuevos documentos esperan la siguiente ingesta. Segundo, los números formales de referencia existen como infraestructura pero aún no como un artefacto publicado — el movimiento más fuerte disponible es ejecutar el conjunto RAGAS in-repo contra el conjunto dorado y publicar los números junto a la metodología. Tercero, RAG1 sigue evaluándose solo en arquitectura; su calidad de recuperación no está documentada fuera del uso interno.

Ninguna de estas es estructural. Las tres son semanas, no trimestres.

Por qué esto importa más allá de una sola empresa

El mercado de 2026 está saturado de "asistentes de cumplimiento de IA" que son envoltorios delgados sobre modelos de propósito general: una incrustación por consulta, recuperación solo densa, citas a nivel de nombre de archivo como mucho, sin gobernanza de roles, sin monitorización de deriva y — decisivamente — sin comportamiento de rechazo en premisas fabricadas. Los propios creadores de estándares reconocen las carencias de verificación que estas herramientas cubren.

El sistema evaluado aquí invierte el orden habitual de construcción. No fue construido por un equipo de ML que adquiriera conocimiento del dominio; fue construida por un experto en el sector — treinta años en cadenas internacionales de suministro textil, miembro experto de CIRPASS-2 (EWG1, EWG3), y un Stakeholder Registrado en el JRC (Unidad B5) — adquiriendo ingeniería de recuperación. El corpus sabe qué es un Certificado de Transacción, cuándo llega físicamente en relación con un envío y por qué los métodos ISO de prueba de composición de fibras no pueden distinguir el poliéster reciclado del vírgene. Ese conocimiento está en el índice porque la persona que lo construyó pasó tres décadas aprendiéndolo.

Una canalización de recuperación puede replicarse en un trimestre por un equipo financiado. El corpus y la sentencia codificada en él no pueden. Esa asimetría es el activo defendible.


Reeco® es una plataforma de verificación DPP construida sobre UNTP 0.7.0 y Credenciales Verificables W3C, con un motor propietario de balance de masa por prenda (depósito SIAE). Reeco no bloquea la emisión de DPP: el motor cuantifica la cobertura e informa a la marca, que mantiene la decisión autónoma — por diseño. Stefano Cipriani es fundador de Reeco®, miembro experto de CIRPASS-2 (EWG1, EWG3), accionista registrado en el JRC.