RAG: responder con documentos que el modelo no aprendió

  • inteligencia-artificial

Un modelo de lenguaje puede desconocer la política interna de reembolsos de una empresa aunque redacte con fluidez. Sus parámetros no equivalen a una conexión permanente con archivos privados. RAG añade un proceso que recupera evidencia y la entrega al generador en el momento de responder.

Preparar la biblioteca

La ingestión extrae contenido de PDF, documentos, páginas y otras fuentes. Luego lo divide en fragmentos o chunks y conserva metadatos: origen, sección, fecha y permisos. Un modelo de embeddings transforma texto en vectores numéricos para facilitar la búsqueda por similitud.

Dividir un contrato a mitad de una excepción puede eliminar el contexto necesario para interpretarlo. El tamaño y solapamiento de fragmentos deben evaluarse con preguntas representativas. Tablas y documentos escaneados también requieren extracción adecuada: un índice no corrige texto que nunca se leyó bien.

El pipeline de ingestión prepara la búsqueda. En cada consulta, la recuperación selecciona evidencia que el generador recibe como contexto.
El pipeline de ingestión prepara la búsqueda. En cada consulta, la recuperación selecciona evidencia que el generador recibe como contexto.

Recuperar antes de generar

La pregunta se representa para buscar candidatos compatibles. Un sistema puede combinar búsqueda léxica y vectorial, aplicar filtros y reordenar resultados. Los pasajes elegidos se añaden al contexto junto con la consulta. El modelo produce entonces una respuesta apoyada en ese material y puede señalar sus fuentes.

El índice vectorial facilita encontrar contenido relacionado, pero similitud no significa verdad ni vigencia. Buscar “devolución anual” puede recuperar un documento semánticamente próximo que corresponde a otro producto. La fecha, el alcance y las excepciones importan tanto como la proximidad vectorial.

Qué cambia y qué no

En esta arquitectura, los pesos del generador permanecen fijos: actualizar documentos no exige reentrenarlo. Esto no significa que todos los sistemas RAG deban carecer de entrenamiento. El trabajo original de RAG investigó modelos entrenados que combinan memoria paramétrica y recuperación externa.

La información estará actualizada solo si la ingestión y el índice también lo están. Un archivo que no fue incorporado no puede recuperarse por ese pipeline. Tener citas tampoco demuestra que todas las afirmaciones estén sustentadas: hay que comprobar la correspondencia entre respuesta y pasajes.

Calidad, permisos y evaluación

Un agente también puede realizar varias búsquedas sucesivas cuando la primera consulta no reúne la evidencia necesaria. Esto añade latencia y exige evaluar cuándo detener la recuperación.

Los permisos deben filtrarse antes de entregar contenido al modelo. El hecho de usar RAG no garantiza privacidad: importa dónde se procesa el contexto y quién puede acceder a las fuentes. Los documentos recuperados son datos de consulta; instrucciones incrustadas en ellos no deben sustituir las reglas de la aplicación.

Una evaluación útil separa dos fallos: recuperar evidencia incorrecta y responder mal aun con evidencia correcta. Se miden recuperación, fidelidad, calidad de citas y comportamiento cuando falta información. Ante una política no encontrada, expresar esa ausencia es más fiable que completar la respuesta mediante una suposición.

Referencias