RAG: responder con documentos que el modelo no aprendió
Un modelo de lenguaje puede desconocer la política interna de reembolsos de una empresa aunque redacte con fluidez. Sus parámetros no equivalen a una conexión permanente con archivos privados. RAG añade un proceso que recupera evidencia y la entrega al generador en el momento de responder.
Preparar la biblioteca
La ingestión extrae contenido de PDF, documentos, páginas y otras fuentes. Luego lo divide en fragmentos o chunks y conserva metadatos: origen, sección, fecha y permisos. Un modelo de embeddings transforma texto en vectores numéricos para facilitar la búsqueda por similitud.
Dividir un contrato a mitad de una excepción puede eliminar el contexto necesario para interpretarlo. El tamaño y solapamiento de fragmentos deben evaluarse con preguntas representativas. Tablas y documentos escaneados también requieren extracción adecuada: un índice no corrige texto que nunca se leyó bien.
Recuperar antes de generar
La pregunta se representa para buscar candidatos compatibles. Un sistema puede combinar búsqueda léxica y vectorial, aplicar filtros y reordenar resultados. Los pasajes elegidos se añaden al contexto junto con la consulta. El modelo produce entonces una respuesta apoyada en ese material y puede señalar sus fuentes.
El índice vectorial facilita encontrar contenido relacionado, pero similitud no significa verdad ni vigencia. Buscar “devolución anual” puede recuperar un documento semánticamente próximo que corresponde a otro producto. La fecha, el alcance y las excepciones importan tanto como la proximidad vectorial.
Qué cambia y qué no
En esta arquitectura, los pesos del generador permanecen fijos: actualizar documentos no exige reentrenarlo. Esto no significa que todos los sistemas RAG deban carecer de entrenamiento. El trabajo original de RAG investigó modelos entrenados que combinan memoria paramétrica y recuperación externa.
La información estará actualizada solo si la ingestión y el índice también lo están. Un archivo que no fue incorporado no puede recuperarse por ese pipeline. Tener citas tampoco demuestra que todas las afirmaciones estén sustentadas: hay que comprobar la correspondencia entre respuesta y pasajes.
Calidad, permisos y evaluación
Un agente también puede realizar varias búsquedas sucesivas cuando la primera consulta no reúne la evidencia necesaria. Esto añade latencia y exige evaluar cuándo detener la recuperación.
Los permisos deben filtrarse antes de entregar contenido al modelo. El hecho de usar RAG no garantiza privacidad: importa dónde se procesa el contexto y quién puede acceder a las fuentes. Los documentos recuperados son datos de consulta; instrucciones incrustadas en ellos no deben sustituir las reglas de la aplicación.
Una evaluación útil separa dos fallos: recuperar evidencia incorrecta y responder mal aun con evidencia correcta. Se miden recuperación, fidelidad, calidad de citas y comportamiento cuando falta información. Ante una política no encontrada, expresar esa ausencia es más fiable que completar la respuesta mediante una suposición.