Um LLM sozinho sabe muito do mundo, mas nada sobre o seu negócio — seus manuais, contratos, procedimentos, base de conhecimento. O RAG conecta o modelo aos seus documentos, criando um assistente que responde com base neles. E dá para rodar tudo self-hosted, sem que um único arquivo saia do seu servidor.
O que é RAG (sem jargão)
RAG significa Retrieval-Augmented Generation — "geração aumentada por recuperação". A ideia é simples:
- Quando você faz uma pergunta, o sistema busca (retrieval) os trechos mais relevantes nos seus documentos.
- Ele entrega esses trechos ao modelo junto com a pergunta.
- O modelo gera a resposta baseada naquele contexto — citando o que está nos seus arquivos.
Em vez de o modelo "chutar" da memória, ele responde a partir da sua fonte de verdade. É como dar a ele uma consulta aberta aos seus documentos na hora de responder.
Por que RAG em vez de "treinar" o modelo
Treinar (fine-tuning) um modelo com seus dados é caro, lento e precisa de GPU. O RAG resolve o mesmo problema de forma muito mais barata e flexível:
| Fine-tuning | RAG | |
|---|---|---|
| Custo | Alto (GPU, tempo) | Baixo |
| Atualizar dados | Retreinar | Só adicionar o documento |
| Rastreabilidade | Difícil | Cita a fonte |
| Roda em CPU | Difícil | Sim (com modelo pequeno) |
Para a maioria dos casos de "IA que conhece meus documentos", RAG é a resposta certa — e roda numa VPS de CPU.
Como o RAG funciona por dentro (o mínimo técnico)
- Seus documentos são quebrados em pedaços e convertidos em embeddings (representações numéricas do significado).
- Esses embeddings ficam num banco vetorial.
- Na pergunta, o sistema busca no banco vetorial os pedaços mais semanticamente próximos e os passa ao LLM.
O bom: as ferramentas modernas escondem essa complexidade. Você sobe os documentos e elas cuidam do resto.
Ferramentas para montar RAG self-hosted
- Open WebUI — já traz RAG embutido: envie documentos e converse com eles direto na interface. É o caminho mais fácil. Veja o guia do Open WebUI.
- AnythingLLM — aplicação dedicada a "converse com seus documentos", com gestão de bases e usuários.
- n8n — para fluxos de RAG customizados dentro de automações. Veja IA + n8n.
Todas se conectam ao Ollama rodando os modelos localmente.
Casos de uso reais
- Suporte interno — a equipe pergunta e o bot responde com base nos manuais e procedimentos.
- Base de conhecimento — transforme sua documentação num assistente que qualquer um consulta.
- Contratos e políticas — "o que diz nossa política sobre X?" respondido a partir dos documentos.
- Onboarding — novos funcionários perguntam ao invés de garimpar PDFs.
- Atendimento — respostas a partir da sua FAQ e documentação de produto.
A grande vantagem: privacidade
Num RAG self-hosted, os documentos e as perguntas nunca saem do seu servidor. Para dados sensíveis — contratos, informações de clientes, propriedade intelectual — isso é decisivo. Enviar esse material para uma API de terceiros muitas vezes nem é uma opção por conformidade. Self-hosted, é. Veja por que rodar IA localmente.
Monte seu assistente de documentos
Um modelo pequeno em CPU + RAG já entrega um assistente útil sobre a sua base de conhecimento, com privacidade total. Precisa apenas de uma VPS com RAM:
Comece pela dupla Ollama + Open WebUI e ative o RAG.

