Se você chegou até aqui na série, já deu memória à sua IA e aprendeu a não perder seu trabalho. O próximo degrau aparece quando sua IA tem que lidar com MUITA informação: dezenas de PDFs, um manual enorme, transcrições, a base do seu negócio. É aí que o RAG brilha: em vez de jogar tudo na IA toda vez (caríssimo em tokens), ele passa só os pedacinhos relevantes — e é aí que você economiza muitíssimo dinheiro. MAS tem uma verdade incômoda que quase ninguém diz: se sua informação é pequena, montar um RAG é se complicar e gastar demais. Neste guia você vai entender o que é RAG em bom português, por que ele economiza tokens, a regra exata (da própria Anthropic) para saber quando SIM, e as TRÊS formas de implementá-lo conforme seu nível: sem código, com um repo open-source, e o RAG de um superaplicativo — o mesmo que usamos, por dentro. Sem enrolação, em ordem, passo a passo.
A necessidade surge num momento muito concreto: quando sua IA tem que trabalhar com muita informação de uma vez e começa a falhar. Sinais típicos: você sobe 30 PDFs e a IA "esquece" da metade; você cola um manual longo e ela responde misturando coisas ou inventando; ou você tem que colar o mesmo documentão em cada conversa porque ela não o retém. É aí que alguém te diz "você precisa de um RAG".
RAG significa "geração aumentada por recuperação". Soa horrível, mas a ideia é simples: em vez de jogar TODOS os seus documentos na IA toda vez (caríssimo e impossível se forem muitos), você guarda seus documentos à parte e, quando pergunta algo, um buscador recupera só os pedacinhos relevantes e os passa para a IA responder com aquilo. Buscar primeiro, responder depois.
A grande vantagem extra: como a IA responde a partir de pedaços concretos dos SEUS documentos, ela pode citar a fonte ("isso está no manual, página 12"). É isso que mata as invenções: se não está nos seus documentos, ela não inventa.
Aqui está a razão principal pela qual o RAG existe, e ela não é pequena: a economia de dinheiro. Cada palavra que você enfia na IA custa tokens, e tokens custam dinheiro. Se você tem 5.000 páginas de documentos e cola todas inteiras em CADA pergunta, paga uma fortuna (e muitas vezes nem cabe). O RAG resolve isso: em vez de mandar as 5.000 páginas, manda só os 3 ou 4 pedacinhos que de fato respondem sua pergunta.
Chunk em inglês significa "pedaço" ou "trecho". É a peça central do RAG, então vale entendê-la. Seus documentos NÃO são guardados inteiros: eles são cortados em pedaços pequenos —cada chunk costuma ser um parágrafo ou dois— e cada pedaço é guardado com uma espécie de "impressão digital do seu significado".
Aqui está o dado que quase nenhum "guru" te conta, e vem da própria Anthropic (os criadores do Claude). A regra é surpreendentemente generosa:
Por que isso importa tanto? Porque 500 páginas é muitíssima coisa para a maioria dos projetos. Seu manual de marca, seus templates, as políticas do seu negócio, um par de livros… normalmente cabe. E se cabe, montar um RAG é complicar sua vida sem motivo. RAG é para quando você de fato passa desse tamanho: bibliotecas enormes, milhares de documentos, dados que mudam o tempo todo.
RAG não é o primeiro passo nem o último — é um degrau numa escada. Suba-a em ordem, não pule degraus por modinha:
Não há uma só maneira de montar um RAG: há três, de menos a mais esforço e poder. O importante é escolher a que de fato te corresponde, não a mais impressionante. Aqui estão elas, e depois vamos uma por uma:
Se você passou pelo filtro e de fato é caso de RAG, boas notícias: você não precisa programar nem montar bancos de dados. Existem ferramentas onde você arrasta seus documentos e pronto, já tem seu buscador inteligente com citações. Duas que qualquer pessoa pode usar hoje:
Quando seu projeto cresce ou você quer ter o controle no seu próprio servidor, existem ferramentas open-source potentes e gratuitas. As duas mais amigáveis para não-especialistas (sua IA te ajuda a instalá-las):
RAGFlow — motor de RAG open-source líder, pensado para não-desenvolvedores: você monta seu pipeline de forma visual e ele entende documentos complexos (Word, PDFs, Excel, escaneados, imagens). Responde com citações da fonte. Funde RAG com capacidades de agente.
AnythingLLM — app de desktop "tudo em um" para ter seu próprio chat com RAG sobre seus documentos, local e privado. "Pare de alugar sua inteligência, torne-a sua." Ideal se você quer que seus dados não saiam da sua máquina.
Quero montar um RAG open-source sobre meus documentos usando um destes repos: - RAGFlow (https://github.com/infiniflow/ragflow) — RAG visual, ideal se eu quiser algo completo. - AnythingLLM (https://github.com/Mintplex-Labs/anything-llm) — app de desktop, local e privado. Me guie passo a passo em linguagem simples, assumindo que eu não sei programar: 1. Me ajude a escolher qual me convém conforme meu caso: [descreva seus documentos, se você quer que tudo seja local/privado, e seu sistema operacional]. 2. Me diga como instalá-lo (com seus requisitos, ex.: Docker) e faça você onde puder. 3. Me ajude a subir meus documentos e criar a base de conhecimento. 4. Configure para que ele responda SÓ com o que está nos meus documentos e SEMPRE cite a fonte. 5. Me dê 3 perguntas de teste para confirmar que está lendo bem meus documentos. Se algum passo eu tiver que fazer na mão, me diga com instruções exatas.
A terceira forma é a mais séria: quando você constrói um superaplicativo —uma plataforma com muitíssima informação e muitos usuários— nenhuma ferramenta pronta dá conta. Aí você constrói seu próprio motor de RAG sob medida. É nível engenheiro (você ou sua equipe dirigindo agentes de código), mas mostramos por dentro, sem enrolação, para você ver aonde dá para chegar: é assim que funciona o motor de RAG que usamos nos nossos aplicativos.
pgvector (sobre Supabase) + um índice HNSW para buscar rápido entre centenas de milhares de vetores.Copie e cole no seu agente de código (Claude Code, Cursor) quando for construir um RAG sob medida. Ele já traz integradas as decisões que funcionam para nós, para que comece em terreno sólido em vez de improvisar:
Você vai me ajudar a construir um RAG sob medida para um aplicativo em grande escala. NÃO escreva código ainda. Primeiro PLANEJE comigo, porque o erro mais caro é codar sem ter decidido a arquitetura. PASSO 1 — Me entreviste (uma pergunta por vez, em linguagem simples): - Que informação o RAG vai indexar e quanto? (tipos de documento, volume aproximado) - Quantos usuários e quantas consultas por dia você espera? - Os dados mudam com frequência? Preciso apagar/atualizar chunks? - É multi-inquilino (vários clientes com dados separados)? Há dados sensíveis? - Que stack eu já uso (banco de dados, linguagem, onde está hospedado)? PASSO 2 — Proponha a arquitetura, usando estas decisões testadas como ponto de partida (e me diga se no meu caso convém mudá-las e por quê): - Base vetorial: PostgreSQL + pgvector com índice HNSW (se eu já uso Postgres/Supabase, reutilize). - Embeddings: um modelo econômico ou grátis (ex.: Gemini), guardando a dimensão que você escolher. - Chunking: pedaços de ~200 tokens com um pouco de sobreposição, e guarde metadados (fonte, data, seção). - Busca híbrida: combine vetorial + texto exato, e um re-ranking para subir o mais relevante. - Isolamento: se for multi-inquilino, filtre SEMPRE pelo id do cliente em cada consulta. PASSO 3 — Me dê um PLANO POR FASES (o que construir primeiro, o que deixar para depois) com uma fase mínima que funcione end-to-end antes de otimizar. PASSO 4 — Liste os 5 erros mais comuns num RAG de produção e como evitá-los desde o dia um (ex.: não filtrar por inquilino, chunks mal cortados, não lidar com atualizações, confiar sem citar a fonte, não medir a qualidade das respostas). Quando aprovarmos o plano, só aí começamos a construir a fase 1, passo a passo, e salvamos o progresso no GitHub a cada fase que funcionar.
Antes de montar qualquer coisa, deixe sua IA te dizer em qual degrau você está de verdade. Copie e cole no ChatGPT, Claude ou seu agente:
Quero saber se de fato preciso de um RAG ou se estou me complicando. Me faça estas perguntas uma por uma, espere minha resposta, e no final me diga em qual degrau estou e por quê: 1. Quantos documentos eu tenho, aproximadamente, e de que tamanho? (um cálculo grosseiro do total de páginas) 2. Essa informação muda com frequência ou é estável? 3. Preciso que ele cite a fonte de cada resposta? 4. É só para mim, ou para um app que muitas pessoas vão usar? 5. Que ferramenta de IA eu uso hoje? Regras para sua recomendação: - Se todo o meu material cabe em ~500 páginas (uns 200.000 tokens), me diga que NÃO preciso de RAG: que eu cole tudo no contexto, é mais simples e preciso. - Se é claramente mais que isso, ou muda muito, ou é para muitos usuários, me recomende RAG e me diga se o caminho sem código (NotebookLM / Custom GPT) dá conta ou se preciso de algo open-source. - Não me empurre para superengenharia. Me recomende o degrau MAIS SIMPLES que resolve meu caso, e justifique.
Se o diagnóstico disse "sim, RAG sem código", este prompt te guia a montá-lo e, sobretudo, a verificar que ele está de fato lendo seus documentos e não inventando:
Vou montar um RAG sem código para consultar meus documentos. Me guie passo a passo, em linguagem simples, assumindo que eu não sei programar. 1. Me recomende entre NotebookLM (grátis) e um Custom GPT do ChatGPT conforme meu caso: eu tenho [descreva seus documentos: quantos, de que tipo, para que vou consultá-los]. 2. Me diga os passos exatos (com cliques) para criar o espaço e subir meus documentos. 3. Redija para mim as instruções que devo colocar para que ele responda SÓ com o que está nos meus documentos, cite a fonte, e diga claramente "não está nos documentos" em vez de inventar. 4. Me dê 3 perguntas de teste para confirmar que ele está de fato lendo meus documentos (e não respondendo de memória geral). 5. Me diga como perceber se ele está inventando, e o que ajustar se acontecer. Faça simples. Se algo eu só posso fazer eu mesmo na web, me diga com os cliques exatos.
O RAG é uma peça poderosa, mas é só uma: busca nos seus documentos. Quando você constrói um app de verdade, esse app precisa também lembrar de cada usuário e, às vezes, entender como tudo se conecta. As três coisas juntas —RAG + memória + grafo— formam o que se chama de brain, o cérebro próprio do seu app. Esse é o próximo recurso, e junta tudo o que você viu.
Join 4,200+ builders. No credit card. Build your first app with AI in minutes.