IAEXPLICADO FÁCIL3 MIN

Qué es RAG y por qué permite que una IA responda con tus documentos

RAG busca fragmentos relevantes antes de generar una respuesta. No reentrena el modelo y tampoco elimina por arte de magia las alucinaciones.

Especialistas de Google explican un sistema RAG
Imagen: Google Cloud Tech
01

RAG significa generar después de recuperar información

La generación aumentada por recuperación, o RAG, conecta un modelo de lenguaje con una fuente externa. Antes de responder, el sistema busca pasajes relacionados con la pregunta. Después añade esos fragmentos al prompt para que el modelo redacte apoyándose en ellos.

Google Cloud define RAG como la combinación de búsqueda tradicional, bases de datos y modelos generativos. Puede usar información privada, especializada o reciente que no estaba en el entrenamiento original.

02

El proceso completo en cuatro pasos

Primero se preparan documentos, se dividen en fragmentos y se guardan en un índice. Muchos sistemas convierten cada fragmento en un embedding, una representación numérica de su significado. Cuando llega una pregunta, la búsqueda encuentra los fragmentos más próximos y puede reordenarlos por relevancia.

El modelo recibe la pregunta junto a ese contexto y genera la respuesta. Si la aplicación conserva la procedencia, también puede mostrar citas. RAG no modifica los pesos del modelo y no equivale a entrenarlo de nuevo. Solo cambia la información disponible para esa petición.

Especialista de AWS presenta los fundamentos de RAG
Imagen: Amazon Web Services
03

Qué resuelve y qué no

RAG es útil para asistentes sobre manuales, normativas, catálogos o archivos internos. Actualizar el índice suele ser más rápido que reentrenar. También reduce la cantidad de texto que debe entrar en cada consulta y facilita enlazar la respuesta con su documento original.

No garantiza la verdad. Si la búsqueda recupera un fragmento irrelevante, antiguo o sin permisos correctos, la respuesta puede fallar con mucha seguridad. La calidad depende del corte de documentos, el índice, la consulta, el reordenamiento y las instrucciones. Nuestra guía de ventana de contexto explica por qué no conviene enviar una biblioteca completa al modelo.

Especialista de IBM muestra un flujo RAG práctico
Imagen: IBM Technology
04

RAG, búsqueda web y ajuste fino no son lo mismo

RAG recupera información para una consulta. La búsqueda web es una posible fuente, pero también puede ser una carpeta privada o una base de datos. El ajuste fino cambia el comportamiento del modelo mediante ejemplos y resulta más apropiado para tono, formato o una tarea repetible que para memorizar datos que cambian.

Un producto puede combinar las tres técnicas. Para documentos sensibles, además debe aplicar permisos antes de recuperar contenido. La IA local y la IA en la nube cambian dónde se ejecuta el sistema, mientras que nuestra explicación de cómo funciona ChatGPT aclara qué hace el modelo cuando recibe ese contexto.

00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

SIGUE LEYENDO

También te puede interesar

PORTADA