RAG (Geração Aumentada por Recuperação)
Técnica que busca informações nos seus documentos e as entrega ao LLM junto com a pergunta, para que ele responda com base em dados reais e atualizados, reduzindo alucinações.
RAG (Retrieval-Augmented Generation, geração aumentada por recuperação) é a técnica que conecta um LLM a uma base de conhecimento própria. Em vez de o modelo responder só com o que aprendeu no treinamento, o sistema primeiro recupera os trechos mais relevantes dos seus documentos e os inclui no prompt; o modelo então gera a resposta apoiado nesse contexto.
O fluxo típico: os documentos são divididos em trechos e convertidos em embeddings (vetores numéricos que capturam significado), armazenados num banco vetorial (como Pinecone). Quando chega uma pergunta, ela também vira embedding, o sistema busca os trechos mais parecidos e monta o prompt com eles. Resultado: respostas ancoradas em fontes, com possibilidade de citar de onde veio cada informação.
Quando usar: sempre que o LLM precisa responder sobre conteúdo que ele não conhece (documentação interna, catálogos, contratos, dados recentes) sem o custo de um fine-tuning. Exemplo concreto: um chatbot de suporte com RAG sobre o manual do produto responde "como reseto minha senha?" citando o passo a passo exato da versão atual do manual, em vez de inventar um procedimento genérico.