RAG significa generar después de recuperar información
La generación aumentada por recuperación, o RAG, conecta un modelo de lenguaje con una fuente externa. Antes de responder, el sistema busca pasajes relacionados con la pregunta. Después añade esos fragmentos al prompt para que el modelo redacte apoyándose en ellos.
Google Cloud define RAG como la combinación de búsqueda tradicional, bases de datos y modelos generativos. Puede usar información privada, especializada o reciente que no estaba en el entrenamiento original.
El proceso completo en cuatro pasos
Primero se preparan documentos, se dividen en fragmentos y se guardan en un índice. Muchos sistemas convierten cada fragmento en un embedding, una representación numérica de su significado. Cuando llega una pregunta, la búsqueda encuentra los fragmentos más próximos y puede reordenarlos por relevancia.
El modelo recibe la pregunta junto a ese contexto y genera la respuesta. Si la aplicación conserva la procedencia, también puede mostrar citas. RAG no modifica los pesos del modelo y no equivale a entrenarlo de nuevo. Solo cambia la información disponible para esa petición.

Qué resuelve y qué no
RAG es útil para asistentes sobre manuales, normativas, catálogos o archivos internos. Actualizar el índice suele ser más rápido que reentrenar. También reduce la cantidad de texto que debe entrar en cada consulta y facilita enlazar la respuesta con su documento original.
No garantiza la verdad. Si la búsqueda recupera un fragmento irrelevante, antiguo o sin permisos correctos, la respuesta puede fallar con mucha seguridad. La calidad depende del corte de documentos, el índice, la consulta, el reordenamiento y las instrucciones. Nuestra guía de ventana de contexto explica por qué no conviene enviar una biblioteca completa al modelo.

RAG, búsqueda web y ajuste fino no son lo mismo
RAG recupera información para una consulta. La búsqueda web es una posible fuente, pero también puede ser una carpeta privada o una base de datos. El ajuste fino cambia el comportamiento del modelo mediante ejemplos y resulta más apropiado para tono, formato o una tarea repetible que para memorizar datos que cambian.
Un producto puede combinar las tres técnicas. Para documentos sensibles, además debe aplicar permisos antes de recuperar contenido. La IA local y la IA en la nube cambian dónde se ejecuta el sistema, mientras que nuestra explicación de cómo funciona ChatGPT aclara qué hace el modelo cuando recibe ese contexto.
La conversación empieza aquí
Accede con una cuenta de apoyo para comentar. Entrar




Todavía no ha comentado nadie. ¿Estrenas tú?