NeuralOS
GuideIntermediate

RAG sem enrolação · quando você DE FATO precisa dele (e quando é jogar dinheiro fora)

Se você chegou até aqui na série, já deu memória à sua IA e aprendeu a não perder seu trabalho. O próximo degrau aparece quando sua IA tem que lidar com MUITA informação: dezenas de PDFs, um manual enorme, transcrições, a base do seu negócio. É aí que o RAG brilha: em vez de jogar tudo na IA toda vez (caríssimo em tokens), ele passa só os pedacinhos relevantes — e é aí que você economiza muitíssimo dinheiro. MAS tem uma verdade incômoda que quase ninguém diz: se sua informação é pequena, montar um RAG é se complicar e gastar demais. Neste guia você vai entender o que é RAG em bom português, por que ele economiza tokens, a regra exata (da própria Anthropic) para saber quando SIM, e as TRÊS formas de implementá-lo conforme seu nível: sem código, com um repo open-source, e o RAG de um superaplicativo — o mesmo que usamos, por dentro. Sem enrolação, em ordem, passo a passo.

Jun 19, 202612 min
Você está no degrau 3 da série
Este guia assume que você já viu o de [memória para a sua IA](/recursos/memoria-para-tu-ia-herramientas) (degrau 1) e o do [GitHub](/recursos/guarda-todo-en-github-antes-de-que-la-ia-lo-rompa) (sua rede de segurança). Aqui subimos um degrau: o que fazer quando a informação é DEMAIS para o chat. Você não precisa programar.

Quando surge a necessidade? (o momento exato)

A necessidade surge num momento muito concreto: quando sua IA tem que trabalhar com muita informação de uma vez e começa a falhar. Sinais típicos: você sobe 30 PDFs e a IA "esquece" da metade; você cola um manual longo e ela responde misturando coisas ou inventando; ou você tem que colar o mesmo documentão em cada conversa porque ela não o retém. É aí que alguém te diz "você precisa de um RAG".

A dor dupla que este guia ataca
Existem duas dores, não uma. A primeira: sua IA inventa ou ignora seus documentos longos, ou dispara sua conta de tokens enfiando-os inteiros de novo e de novo → caro e pouco confiável. A segunda, ao contrário: por medo de ficar sem, você monta um RAG que não precisava → infraestrutura e complexidade de graça. RAG bem colocado resolve a primeira (e economiza muito); mal colocado, é a segunda. Este guia te dá a regra para acertar.

RAG em bom português (sem uma única palavra técnica)

RAG significa "geração aumentada por recuperação". Soa horrível, mas a ideia é simples: em vez de jogar TODOS os seus documentos na IA toda vez (caríssimo e impossível se forem muitos), você guarda seus documentos à parte e, quando pergunta algo, um buscador recupera só os pedacinhos relevantes e os passa para a IA responder com aquilo. Buscar primeiro, responder depois.

Imagine assim · o bibliotecário
Sem RAG, você pede à sua IA que leia a biblioteca inteira toda vez que pergunta algo — lento, caro e ela se atrapalha. Com RAG, você tem um bibliotecário que conhece as estantes: você pergunta, ele vai, traz os 3 livros que servem, e a IA responde com esses. Ela não lê tudo: traz o necessário.

A grande vantagem extra: como a IA responde a partir de pedaços concretos dos SEUS documentos, ela pode citar a fonte ("isso está no manual, página 12"). É isso que mata as invenções: se não está nos seus documentos, ela não inventa.

O grande benefício: RAG economiza MUITOS tokens (quando o corpus é grande)

Aqui está a razão principal pela qual o RAG existe, e ela não é pequena: a economia de dinheiro. Cada palavra que você enfia na IA custa tokens, e tokens custam dinheiro. Se você tem 5.000 páginas de documentos e cola todas inteiras em CADA pergunta, paga uma fortuna (e muitas vezes nem cabe). O RAG resolve isso: em vez de mandar as 5.000 páginas, manda só os 3 ou 4 pedacinhos que de fato respondem sua pergunta.

A conta que explica
Sem RAG: 5.000 páginas × cada pergunta = milhares de tokens toda vez. Com RAG: só os pedaços relevantes = umas poucas centenas de tokens. O mesmo resultado, uma fração do custo. Por isso o RAG é a forma padrão de dar a uma IA acesso a informação grande sem se arruinar. Essa economia é real e contínua… desde que seu corpus seja de fato grande. Se for pequeno, a conta se inverte (vemos isso na regra de ouro, abaixo).

Por que se chamam "chunks"? (a peça-chave do RAG)

Chunk em inglês significa "pedaço" ou "trecho". É a peça central do RAG, então vale entendê-la. Seus documentos NÃO são guardados inteiros: eles são cortados em pedaços pequenos —cada chunk costuma ser um parágrafo ou dois— e cada pedaço é guardado com uma espécie de "impressão digital do seu significado".

Por que picar e não guardar o documento inteiro?
Porque quando você pergunta algo, você não quer que o RAG te traga um livro de 300 páginas — você quer o parágrafo exato que responde. Picar em chunks permite trazer justamente isso: a unidade pequena e precisa que serve, não o documento completo. Menos ruído, respostas mais certeiras, e muitíssimos menos tokens. É o que faz o RAG ser preciso E barato ao mesmo tempo.

A regra de ouro · você realmente precisa de RAG?

Aqui está o dado que quase nenhum "guru" te conta, e vem da própria Anthropic (os criadores do Claude). A regra é surpreendentemente generosa:

O que a Anthropic diz, textualmente
"Se a sua base de conhecimento é menor que 200.000 tokens (umas 500 páginas de material), você pode simplesmente incluir toda a base de conhecimento no prompt que dá ao modelo, sem necessidade de RAG." Tradução: se todo o seu material cabe em ~500 páginas, você NÃO precisa de RAG. Você cola tudo na IA e pronto. Mais simples, mais preciso, e com o "prompt caching" de hoje, também mais barato.

Por que isso importa tanto? Porque 500 páginas é muitíssima coisa para a maioria dos projetos. Seu manual de marca, seus templates, as políticas do seu negócio, um par de livros… normalmente cabe. E se cabe, montar um RAG é complicar sua vida sem motivo. RAG é para quando você de fato passa desse tamanho: bibliotecas enormes, milhares de documentos, dados que mudam o tempo todo.

Você precisa de RAG (de verdade) se…
Seu material NÃO cabe em ~500 páginas (milhares de documentos, um banco de dados grande, anos de transcrições).
A informação muda com frequência e você não quer re-colar tudo toda vez.
Você está construindo um app para muitos usuários que consultam um corpus grande (ex.: um assistente que responde sobre toda a sua documentação).
Você precisa de citações da fonte de forma sistemática e em grande escala.
Você NÃO precisa de RAG (evite a confusão) se…
Seu material cabe em ~500 páginas → cole no contexto. Com prompt caching, repeti-lo sai barato — mais barato que montar um RAG.
Você só quer que a IA lembre das suas regras e do seu projeto → isso é memória (degrau 1), não RAG.
Você tem um punhado de documentos que consulta de vez em quando → suba-os ao chat quando precisar.
Você mal está começando → quase com certeza está um ou dois degraus abaixo do RAG.
O hábito de critério (o mais importante)
Antes de subir de degrau, transforme em reflexo se perguntar: "isso cabe numa conversa, ou é de fato demais?" Não suba por modinha. Comece simples (memória/contexto), e suba para RAG só quando o degrau de baixo ficar realmente curto. Essa pergunta te economiza tempo e dinheiro de novo e de novo.

A escada completa (para você ver onde o RAG se encaixa)

RAG não é o primeiro passo nem o último — é um degrau numa escada. Suba-a em ordem, não pule degraus por modinha:

Do simples ao poderoso
1 · Memória / contexto — suas regras e seu projeto num arquivo ou no chat. Serve para quase tudo. (Degrau 1 da série.)
2 · Colar tudo + caching — se seu material cabe em ~500 páginas, jogue tudo. Sem RAG.
3 · RAG sem código — quando é demais: um buscador que traz os pedaços relevantes. (Este guia.)
4 · RAG "de verdade" — para apps em escala, com banco de dados vetorial. Open-source, já com alguma técnica.
5 · Grafo de conhecimento — quando você também precisa que a IA entenda COMO tudo se conecta. (Graphify, no final.)

As 3 formas de implementar um RAG (escolha conforme seu nível)

Não há uma só maneira de montar um RAG: há três, de menos a mais esforço e poder. O importante é escolher a que de fato te corresponde, não a mais impressionante. Aqui estão elas, e depois vamos uma por uma:

Suas três opções
Forma 1 · Sem código — você arrasta documentos para uma ferramenta pronta (NotebookLM, Custom GPT). Zero técnica. Para a maioria.
Forma 2 · Com um repo open-source — você instala algo como RAGFlow ou AnythingLLM, controle total, grátis. Seu agente de código te ajuda.
Forma 3 · Sob medida (superaplicativo) — você constrói seu próprio motor para um app em grande escala. Nível engenheiro. Te mostro como é o nosso.

Forma 1 · Montar um RAG SEM escrever código (o caminho fácil)

Se você passou pelo filtro e de fato é caso de RAG, boas notícias: você não precisa programar nem montar bancos de dados. Existem ferramentas onde você arrasta seus documentos e pronto, já tem seu buscador inteligente com citações. Duas que qualquer pessoa pode usar hoje:

NotebookLM (Google · grátis)
Você sobe seus documentos (PDFs, sites, textos) para um "caderno" e pergunta em linguagem natural. Ele responde citando a fonte exata de cada afirmação — adeus invenções. É RAG puro, sem que você precise saber o que é RAG. (Os limites de tamanho e número de fontes mudam conforme o plano; verifique os vigentes ao usar.)
Custom GPT (ChatGPT · plano pago)
Você cria um GPT, sobe seus arquivos, e o ChatGPT monta o buscador por dentro automaticamente. Você só conversa com ele. Ideal se você já paga o ChatGPT e quer um assistente que conheça os SEUS documentos.
Regra anti-invenção
Quando montar seu RAG sem código, dê SEMPRE esta instrução: "responda unicamente com o que estiver nos meus documentos e cite a fonte; se não estiver, diga isso claramente em vez de inventar". Isso transforma seu RAG numa fonte confiável, não num adivinho cheio de confiança.

Forma 2 · Com um repo open-source (mais controle)

Quando seu projeto cresce ou você quer ter o controle no seu próprio servidor, existem ferramentas open-source potentes e gratuitas. As duas mais amigáveis para não-especialistas (sua IA te ajuda a instalá-las):

infiniflow/ragflow
REPO

RAGFlow — motor de RAG open-source líder, pensado para não-desenvolvedores: você monta seu pipeline de forma visual e ele entende documentos complexos (Word, PDFs, Excel, escaneados, imagens). Responde com citações da fonte. Funde RAG com capacidades de agente.

PythonApache-2.0View on GitHub
Mintplex-Labs/anything-llm
REPO

AnythingLLM — app de desktop "tudo em um" para ter seu próprio chat com RAG sobre seus documentos, local e privado. "Pare de alugar sua inteligência, torne-a sua." Ideal se você quer que seus dados não saiam da sua máquina.

JavaScriptMITView on GitHub
Cole no seu agente · instalar um RAG sério com um repotexto
Quero montar um RAG open-source sobre meus documentos usando um destes repos:
- RAGFlow (https://github.com/infiniflow/ragflow) — RAG visual, ideal se eu quiser algo completo.
- AnythingLLM (https://github.com/Mintplex-Labs/anything-llm) — app de desktop, local e privado.

Me guie passo a passo em linguagem simples, assumindo que eu não sei programar:
1. Me ajude a escolher qual me convém conforme meu caso: [descreva seus documentos, se você quer que tudo seja local/privado, e seu sistema operacional].
2. Me diga como instalá-lo (com seus requisitos, ex.: Docker) e faça você onde puder.
3. Me ajude a subir meus documentos e criar a base de conhecimento.
4. Configure para que ele responda SÓ com o que está nos meus documentos e SEMPRE cite a fonte.
5. Me dê 3 perguntas de teste para confirmar que está lendo bem meus documentos.

Se algum passo eu tiver que fazer na mão, me diga com instruções exatas.
Deixe com o seu agente de código
Não instale nada na mão se você usa um agente como Claude Code: o prompt acima faz com que ele carregue o trabalho pesado. Você só escolhe o repo, fornece os documentos e verifica. Lembre-se de salvar seu progresso no GitHub antes de instalar coisas novas (veja o guia do GitHub da série).

Forma 3 · O RAG de um superaplicativo (é assim que funciona o nosso)

A terceira forma é a mais séria: quando você constrói um superaplicativo —uma plataforma com muitíssima informação e muitos usuários— nenhuma ferramenta pronta dá conta. Aí você constrói seu próprio motor de RAG sob medida. É nível engenheiro (você ou sua equipe dirigindo agentes de código), mas mostramos por dentro, sem enrolação, para você ver aonde dá para chegar: é assim que funciona o motor de RAG que usamos nos nossos aplicativos.

Atenção · isto é o RAG, uma PEÇA — não o cérebro completo
Vamos esclarecer algo importante para não confundir: o que você vê aqui é o motor de busca (o RAG), que é UMA peça. O "cérebro" completo de um app —o que se chama de brain— é mais: junta este RAG com a memória de cada usuário e, às vezes, um grafo de conexões. O RAG é o "o que ele sabe dos seus documentos"; o brain é o cérebro inteiro. Isso vemos no próximo recurso da série.
As peças do nosso RAG (em produção)
Base vetorial: PostgreSQL com a extensão pgvector (sobre Supabase) + um índice HNSW para buscar rápido entre centenas de milhares de vetores.
Embeddings: o modelo que converte cada chunk na sua "impressão digital de significado" — Gemini de 768 dimensões, no tier gratuito (custo $0).
Escala: mais de 15.000 chunks indexados (documentos, código, notas) — impossível de enfiar num chat; aqui RAG não é luxo, é a única forma.
Busca híbrida: 70% por significado (vetorial) + 30% por palavra exata (texto), com re-ranking que sobe o mais relevante. Mais certeira que qualquer uma das duas sozinha.
Índice que se autocuida: o sistema re-indexa o que está danificado, marca o velho e descarta o inservível — o RAG se mantém saudável sozinho. (Isto é manutenção do buscador, não a "memória do usuário" — essa é outra peça, a do brain.)
Chunks de ~200 tokens cada um: o tamanho doce entre "traz o parágrafo certo" e "não perde o contexto".
O que isto te ensina
Repare no padrão, porque é a lição de toda a série: comece barato (embeddings grátis, um banco de dados que você já tem) e fica sofisticado só quando a escala exige (15.000+ pedaços). Você não precisa disso para começar — mas agora sabe aonde um RAG cresce quando você constrói algo grande de verdade. Suba de degrau só quando o de baixo ficar curto.
No NeuralOS, esse motor de RAG é parte do produto
Esse motor de RAG sob medida é justamente o que estamos levando para o NeuralOS: cada app e cada agente com sua própria busca sobre seus documentos de grande escala, sem que você monte pgvector nem embeddings. A visão já está desenhada na interface; o motor na nuvem é parte do caminho que construímos. A ideia: que você tenha a Forma 3 sem precisar ser engenheiro.
Antes do prompt: uma expectativa honesta
A Forma 3 não é um copia-e-cola que sai perfeito na primeira tentativa — isso seria te vender enrolação. É um projeto de engenharia de vários dias, com decisões de arquitetura. Por isso o prompt abaixo não diz "construa para mim já": é um prompt de arquiteto que faz a IA PLANEJAR antes de programar. Essa ordem —decidir a arquitetura primeiro, codar depois— é justamente o que evita os erros caros no início.

Copie e cole no seu agente de código (Claude Code, Cursor) quando for construir um RAG sob medida. Ele já traz integradas as decisões que funcionam para nós, para que comece em terreno sólido em vez de improvisar:

Cole no seu agente · arquiteto de um RAG sob medida (Forma 3)texto
Você vai me ajudar a construir um RAG sob medida para um aplicativo em grande escala. NÃO escreva código ainda. Primeiro PLANEJE comigo, porque o erro mais caro é codar sem ter decidido a arquitetura.

PASSO 1 — Me entreviste (uma pergunta por vez, em linguagem simples):
- Que informação o RAG vai indexar e quanto? (tipos de documento, volume aproximado)
- Quantos usuários e quantas consultas por dia você espera?
- Os dados mudam com frequência? Preciso apagar/atualizar chunks?
- É multi-inquilino (vários clientes com dados separados)? Há dados sensíveis?
- Que stack eu já uso (banco de dados, linguagem, onde está hospedado)?

PASSO 2 — Proponha a arquitetura, usando estas decisões testadas como ponto de partida (e me diga se no meu caso convém mudá-las e por quê):
- Base vetorial: PostgreSQL + pgvector com índice HNSW (se eu já uso Postgres/Supabase, reutilize).
- Embeddings: um modelo econômico ou grátis (ex.: Gemini), guardando a dimensão que você escolher.
- Chunking: pedaços de ~200 tokens com um pouco de sobreposição, e guarde metadados (fonte, data, seção).
- Busca híbrida: combine vetorial + texto exato, e um re-ranking para subir o mais relevante.
- Isolamento: se for multi-inquilino, filtre SEMPRE pelo id do cliente em cada consulta.

PASSO 3 — Me dê um PLANO POR FASES (o que construir primeiro, o que deixar para depois) com uma fase mínima que funcione end-to-end antes de otimizar.

PASSO 4 — Liste os 5 erros mais comuns num RAG de produção e como evitá-los desde o dia um (ex.: não filtrar por inquilino, chunks mal cortados, não lidar com atualizações, confiar sem citar a fonte, não medir a qualidade das respostas).

Quando aprovarmos o plano, só aí começamos a construir a fase 1, passo a passo, e salvamos o progresso no GitHub a cada fase que funcionar.
Combine com o resto da série
Este é o momento em que TUDO da série se junta: salve cada fase no GitHub (sua rede de segurança), audite com o protocolo C-A-R antes de dar uma fase como boa, e se o projeto ficar enorme, coloque um grafo por cima (Graphify). Um RAG de produção bem-feito se apoia em todos os degraus anteriores.

Prompt 1 · Diagnóstico — preciso de RAG ou não?

Antes de montar qualquer coisa, deixe sua IA te dizer em qual degrau você está de verdade. Copie e cole no ChatGPT, Claude ou seu agente:

Cole na sua IA · diagnóstico de degrautexto
Quero saber se de fato preciso de um RAG ou se estou me complicando. Me faça estas perguntas uma por uma, espere minha resposta, e no final me diga em qual degrau estou e por quê:

1. Quantos documentos eu tenho, aproximadamente, e de que tamanho? (um cálculo grosseiro do total de páginas)
2. Essa informação muda com frequência ou é estável?
3. Preciso que ele cite a fonte de cada resposta?
4. É só para mim, ou para um app que muitas pessoas vão usar?
5. Que ferramenta de IA eu uso hoje?

Regras para sua recomendação:
- Se todo o meu material cabe em ~500 páginas (uns 200.000 tokens), me diga que NÃO preciso de RAG: que eu cole tudo no contexto, é mais simples e preciso.
- Se é claramente mais que isso, ou muda muito, ou é para muitos usuários, me recomende RAG e me diga se o caminho sem código (NotebookLM / Custom GPT) dá conta ou se preciso de algo open-source.
- Não me empurre para superengenharia. Me recomende o degrau MAIS SIMPLES que resolve meu caso, e justifique.

Prompt 2 · Monte seu mini-RAG sem código e à prova de invenções

Se o diagnóstico disse "sim, RAG sem código", este prompt te guia a montá-lo e, sobretudo, a verificar que ele está de fato lendo seus documentos e não inventando:

Cole na sua IA · montar e verificar seu RAGtexto
Vou montar um RAG sem código para consultar meus documentos. Me guie passo a passo, em linguagem simples, assumindo que eu não sei programar.

1. Me recomende entre NotebookLM (grátis) e um Custom GPT do ChatGPT conforme meu caso: eu tenho [descreva seus documentos: quantos, de que tipo, para que vou consultá-los].
2. Me diga os passos exatos (com cliques) para criar o espaço e subir meus documentos.
3. Redija para mim as instruções que devo colocar para que ele responda SÓ com o que está nos meus documentos, cite a fonte, e diga claramente "não está nos documentos" em vez de inventar.
4. Me dê 3 perguntas de teste para confirmar que ele está de fato lendo meus documentos (e não respondendo de memória geral).
5. Me diga como perceber se ele está inventando, e o que ajustar se acontecer.

Faça simples. Se algo eu só posso fazer eu mesmo na web, me diga com os cliques exatos.

Erros típicos (para você não cair)

Montar RAG quando bastava colar o documento
O erro número um. Se seu material cabe no contexto, RAG só te adiciona complexidade e custo. Primeiro a regra das 500 páginas, depois você decide.
Confundir RAG com memória
RAG não lembra suas conversas nem suas preferências — isso é a memória (degrau 1). RAG busca nos seus documentos. São coisas distintas que se complementam, não rivais.
Confiar sem verificar as citações
Um RAG pode trazer o pedaço errado e soar muito seguro. Por isso o prompt 2 inclui perguntas de teste: confie, mas verifique se ele cita a fonte e se a fonte diz o que ele afirma.

O próximo degrau · de uma peça ao cérebro completo

O RAG é uma peça poderosa, mas é só uma: busca nos seus documentos. Quando você constrói um app de verdade, esse app precisa também lembrar de cada usuário e, às vezes, entender como tudo se conecta. As três coisas juntas —RAG + memória + grafo— formam o que se chama de brain, o cérebro próprio do seu app. Esse é o próximo recurso, e junta tudo o que você viu.

O brain · dê ao seu app um cérebro próprio (o próximo degrau)
O RAG é uma das suas peças. O brain junta todas: o que seu app sabe e o que ele lembra de cada usuário.
A memória da sua IA · o degrau 1 (se você pulou)
Antes de RAG, quase sempre o que você precisa é memória simples. Comece por aqui.
#rag#documentos#contexto#sem-codigo
Ready to build?

Start building in
under 3 minutes

Join 4,200+ builders. No credit card. Build your first app with AI in minutes.