← Volver al glosario

RAG (Generación Aumentada por Recuperación)

Técnica que busca información en tus documentos y la entrega al LLM junto con la pregunta, para que responda con base en datos reales y actualizados, reduciendo alucinaciones.

RAG (Retrieval-Augmented Generation, generación aumentada por recuperación) es la técnica que conecta un LLM con una base de conocimiento propia. En lugar de que el modelo responda solo con lo aprendido en el entrenamiento, el sistema primero recupera los fragmentos más relevantes de tus documentos y los incluye en el prompt; el modelo entonces genera la respuesta apoyado en ese contexto.

El flujo típico: los documentos se dividen en fragmentos y se convierten en embeddings (vectores numéricos que capturan significado), almacenados en una base de datos vectorial (como Pinecone). Cuando llega una pregunta, también se convierte en embedding, el sistema busca los fragmentos más parecidos y arma el prompt con ellos. Resultado: respuestas ancladas en fuentes, con posibilidad de citar de dónde salió cada información.

Cuándo usarlo: siempre que el LLM deba responder sobre contenido que no conoce (documentación interna, catálogos, contratos, datos recientes) sin el costo de un fine-tuning. Ejemplo concreto: un chatbot de soporte con RAG sobre el manual del producto responde "¿cómo restablezco mi contraseña?" citando el paso a paso exacto de la versión actual del manual, en vez de inventar un procedimiento genérico.

Logotipo de Pinecone

Análisis de Datos

Pinecone

Búsqueda vectorial en miles de millones de ítems por similitud en milisegundos: la próxima generación de búsqueda, a una llamada de API.

No disponible
Logotipo de Chatbase

Atención al Cliente

Chatbase

Plataforma de experiencia del cliente con IA: agentes que resuelven consultas complejas y reducen tickets en todos los canales, con 10 mil+ empresas.

No disponible

Categorías

Ver también