Pular para o conteúdo

Arquitetura de IA

Da demo ao produto: os 12 conceitos de uma IA em produção, trabalhando juntos

Embeddings, RAG, cache, roteamento, guardrails, evals: o que cada conceito faz e, mais importante, onde ele entra no caminho de uma pergunta real.

Por Equipe 4it Digital · · 9 min de leitura

Em resumo

  • Uma demo de IA responde a uma pergunta. Um produto responde a milhares, rápido, com custo previsível, sem vazar dados e com qualidade medida. A diferença está na arquitetura ao redor do modelo.
  • Os conceitos funcionam em conjunto: uns preparam o conhecimento antes da pergunta, outros agem no caminho de cada resposta e outros medem o resultado depois, para o sistema melhorar a cada mudança.
  • Nem todo sistema precisa dos 12. A recomendação da Anthropic é começar pelo mais simples que resolve e acrescentar peças só quando a medição mostrar que fazem falta.

Colocar um modelo de linguagem para responder a uma pergunta leva uma tarde. Colocar o mesmo modelo para atender clientes, consultar sistemas e falar em nome da empresa, todos os dias, é outro trabalho. A diferença entre os dois não está no modelo, e sim em tudo o que fica ao redor dele.

Circulam nas redes listas com os conceitos mais importantes para levar uma aplicação de IA à produção: embeddings, bancos vetoriais, RAG, chunking, reranking, cache semântico, roteamento de modelos, guardrails, chamada de ferramentas, memória, evals e streaming. As listas acertam nos itens, mas costumam apresentar cada um isolado, como cartas de um baralho. Na prática, o que importa é a ordem em que eles entram em ação e como um depende do outro.

O jeito mais claro de entender isso é seguir uma pergunta, do momento em que o usuário digita até a resposta aparecer na tela.

O caminho de uma pergunta em produção, e onde entra cada conceito

Antes da pergunta · preparar o conhecimento

ChunkingDivide documentos em trechos pesquisáveis
EmbeddingsTransforma cada trecho em um vetor de significado
Banco vetorialGuarda os vetores e encontra os vizinhos rápido

Feito uma vez e repetido sempre que um documento muda.

Durante a pergunta · o caminho de cada resposta

Pergunta do usuário ↓

  1. 1
    Guardrail de entradaBarra injeção de instruções, dados pessoais e pedidos fora do escopo.
    Bloqueou? Recusa educada, sem chamar o modelo.
  2. 2
    Cache semânticoProcura uma pergunta com o mesmo sentido já respondida.
    Encontrou? Devolve a resposta salva, mais rápida e barata.
  3. 3
    Roteador de modeloEscolhe o modelo pelo tipo de tarefa.
    Tarefa simples, modelo menor. Falhou? Modelo reserva.
  4. 4
    RAG + rerankingBusca no banco vetorial os trechos mais próximos e reordena pela relevância real.
    Só os melhores trechos seguem para o modelo.
  5. 5
    Modelo, ferramentas e memóriaResponde com o contexto, consulta sistemas e se lembra do que importa.
    Ação de risco? Uma pessoa aprova antes.
  6. 6
    Guardrail de saídaConfere dados sensíveis, promessas indevidas e formato.
  7. 7
    StreamingA resposta aparece enquanto é gerada.
    Mesmo tempo total, espera percebida menor.

↓ Resposta

Depois da resposta · medir para melhorar

RegistrosPergunta, contexto, resposta, tempo e custo de cada etapa
EvalsBateria de casos a cada mudança de instrução, modelo ou documento
AjusteSó vai para produção o que melhorou a nota

↻ O ciclo se repete a cada mudança, e o sistema tende a ficar mais confiável a cada volta.

Infográfico 4it Digital. Os 12 conceitos aparecem na ordem em que entram em ação; registros e aprovação humana completam o desenho.

Antes da pergunta: preparar o conhecimento

Para a IA responder com base nos documentos da empresa, e não só no que aprendeu no treinamento, esses documentos precisam estar prontos para busca. Isso acontece antes de qualquer pergunta, e de novo sempre que um documento muda.

  1. Chunking. Manuais, políticas e contratos são divididos em trechos menores, com uma pequena sobreposição entre eles para não cortar uma ideia no meio. Trechos grandes demais trazem ruído; pequenos demais perdem o sentido.
  2. Embeddings. Cada trecho vira um vetor, uma lista de números que representa o significado do texto. Trechos com sentido parecido ficam próximos: "devolução do dinheiro" fica perto de "política de reembolso", mesmo sem nenhuma palavra em comum.
  3. Banco vetorial. Os vetores são guardados num banco feito para encontrar rapidamente os vizinhos mais próximos de uma pergunta, entre milhões de trechos.

Os detalhes dessa etapa pesam muito no resultado. Num estudo publicado pela Anthropic em 2024, acrescentar a cada trecho uma breve explicação de contexto, gerada a partir do documento inteiro e específica daquele trecho, reduziu em 35% as falhas de recuperação. Aplicando o mesmo contexto também à busca por palavras-chave, a redução chegou a 49%, e com reranking, a 67%.

Durante a pergunta: o caminho de cada resposta

  1. Guardrail de entrada. A primeira barreira confere o que chegou: tentativas de manipular o agente com instruções escondidas, dados pessoais que não deveriam entrar e pedidos fora do escopo. A injeção de instruções é o primeiro risco da lista da OWASP para aplicações com modelos de linguagem.
  2. Cache semântico. Se uma pergunta com o mesmo sentido já foi respondida, a resposta salva é devolvida sem chamar o modelo, o que corta custo e tempo. O cuidado é não confundir parecido com igual: "status do pedido 123" e "status do pedido 456" são quase idênticas para um vetor, e respostas pessoais nunca podem ser reaproveitadas entre usuários.
  3. Roteador de modelo. Nem toda tarefa precisa do modelo mais caro. Classificar uma mensagem cabe num modelo pequeno e rápido; um raciocínio longo pede um maior. O roteador também define o modelo reserva, se o principal falhar.
  4. RAG, com reranking. A pergunta vira vetor, o banco devolve os trechos mais próximos e um reranker reordena esses trechos pela relevância real, porque proximidade de significado não é o mesmo que responder à pergunta. Só os melhores vão para o modelo, junto com a pergunta.
  5. Modelo, ferramentas e memória. O modelo responde usando o contexto recebido. Quando precisa de um dado atual, como o status de um pedido, chama uma ferramenta: o sistema da empresa executa a consulta e devolve o resultado. A memória guarda o que importa da conversa e, quando faz sentido, entre conversas. Ações de risco, como um reembolso, passam por aprovação de uma pessoa.
  6. Guardrail de saída. Antes de sair, a resposta é conferida: dados que não podem vazar, promessas que a empresa não faz, formato esperado.
  7. Streaming. A resposta aparece na tela à medida que é gerada. O tempo total é o mesmo, mas a espera percebida cai, e o usuário já começa a ler.

Depois da resposta: medir para melhorar

É aqui que muitos projetos param, e é aqui que um produto se separa de uma demo.

  • Registros de cada etapa. A pergunta, os trechos recuperados, a ferramenta chamada, a resposta, o tempo e o custo de cada passo. Sem isso, quando algo dá errado, ninguém sabe se o problema estava na busca, no modelo ou na instrução.
  • Evals. Uma bateria de casos de teste, com respostas esperadas, roda a cada mudança de instrução, de modelo ou de documentos. Trocar o modelo por um mais novo pode melhorar um tipo de resposta e piorar outro; só a bateria mostra.
  • Ajuste com régua. Só vai para produção a mudança que melhorou a nota. O ciclo se repete, e o sistema tende a ficar melhor a cada volta, em vez de mudar no escuro.

O que as listas costumam deixar de fora

  • Custo por resultado. O total da fatura não diz se o dinheiro foi bem gasto. O que diz é quanto custa cada atendimento resolvido ou cada documento processado.
  • Permissões no RAG. A busca precisa respeitar quem está perguntando. Um vendedor não pode receber, por similaridade, um trecho do contrato de outro cliente ou da folha de pagamento.
  • Pessoas no circuito. Para decisões de impacto, o desenho certo é o agente preparar e uma pessoa aprovar, com a regra clara de quando isso acontece.
  • Plano para quando algo falha. Provedor fora do ar, ferramenta lenta, resposta bloqueada pelo guardrail: o sistema precisa de um caminho previsto para cada caso, e não de uma tela de erro.

Nem todo sistema precisa dos 12

A recomendação da Anthropic para quem constrói com agentes é encontrar a solução mais simples possível e só aumentar a complexidade quando necessário. A mesma empresa observa que, se a base de conhecimento tem menos de 200 mil tokens, cerca de 500 páginas, dá para colocá-la inteira no contexto do modelo, sem RAG.

O assistente deste site é um exemplo. Todo o conteúdo publicado, das ofertas às perguntas frequentes, cabe no contexto do modelo. Por isso ele não usa banco vetorial nem RAG: recebe o conteúdo inteiro, com cache de prompt, em que a parte repetida da instrução custa uma fração do preço normal de entrada. Ele usa streaming, chama uma ferramenta para registrar o atendimento e enviar o resumo à equipe, segue regras no prompt de sistema que fazem o papel de guardrails e tem o modelo configurável. Banco vetorial, reranking e roteador entram quando o volume de documentos ou de conversas pedir.

A ordem que mais funciona na prática começa por onde as listas costumam terminar: primeiro definir o que é uma boa resposta e montar a bateria de testes; depois o caminho mais simples que passa nela; e só então acrescentar peças, uma de cada vez, conferindo na bateria se cada uma ajudou.

Perguntas rápidas

Qual é a diferença entre uma demo de IA e um produto?

A demo mostra que o modelo responde bem a algumas perguntas. O produto responde a milhares, com conhecimento atualizado, proteção contra manipulação e vazamento, custo previsível e qualidade medida a cada mudança. Essa diferença vem da arquitetura ao redor do modelo.

Todo sistema com IA precisa de RAG e banco vetorial?

Não. Se a base de conhecimento cabe no contexto do modelo, algo abaixo de 200 mil tokens segundo a Anthropic, dá para enviá-la inteira, com cache de prompt para reduzir o custo. RAG e banco vetorial fazem sentido quando os documentos são muitos e não cabem no contexto, ou quando enviá-los inteiros a cada pergunta fica caro ou lento demais.

Por qual conceito começar a construir?

Pelas evals. Definir antes o que é uma boa resposta e montar uma bateria de testes permite saber se cada peça acrescentada depois, como cache, reranking ou roteador, melhorou ou piorou o resultado.

Cache semântico tem riscos?

Tem. Perguntas parecidas nem sempre são iguais, como o status de dois pedidos diferentes, e respostas com dados de um usuário nunca podem ser reaproveitadas para outro. O cache precisa de regras sobre o que pode e o que não pode ser reaproveitado.

Na prática

Test Drive: agente de IA em produção em 30 dias

Um agente de IA resolvendo um processo real da sua empresa em 30 dias, com resultado medido.

Fontes

  1. Introducing Contextual Retrieval. Anthropic, 19/09/2024.
  2. Building effective agents. Anthropic, 19/12/2024.
  3. OWASP Top 10 for LLM Applications 2025. OWASP GenAI Security Project, 2025.
  4. Prompt caching. Anthropic (documentação), consultado em 10/2026.

Os dados foram conferidos nas fontes acima na data de publicação. Pesquisas citadas por veículos de imprensa estão indicadas com o nome do veículo.

Leia também

Sistemas legados

Por que a IA trava em sistemas legados gigantes, e o que destrava

Monolitos com milhões de linhas não cabem no que a IA enxerga de uma vez. Veja por que ela erra no legado e o processo que torna a modernização segura.

7 de outubro de 2026 · 8 min de leitura
Segurança de IA

Alucinação de IA em produção: por que acontece e como reduzir

A IA inventa quando é incentivada a chutar. Veja casos reais, os riscos de segurança que andam junto e as seis camadas que tornam um agente confiável.

7 de outubro de 2026 · 8 min de leitura
Custos de IA

Quanto sua empresa realmente gasta com IA

A fatura de IA é só a parte visível. Veja onde o dinheiro vaza, o que é shadow AI e as quatro alavancas que reduzem o custo sem reduzir o uso.

6 de outubro de 2026 · 7 min de leitura