Em resumo
- Modelos de IA inventam respostas porque foram treinados e avaliados de um jeito que recompensa o chute em vez do "não sei". Isso se reduz com desenho, não com esperança.
- Alucinação também é risco de segurança: código gerado por IA cita pacotes que não existem, e atacantes registram esses nomes para distribuir código malicioso.
- Seis camadas tornam um agente confiável em produção: fontes aprovadas, permissão para não saber, limite de ação, verificação contínua, proteção contra injeção e rastreabilidade.
Em 2024, um tribunal do Canadá condenou a Air Canada a indenizar um cliente com base numa política de desconto que não existia: ela tinha sido inventada pelo chatbot da empresa, e a companhia foi responsabilizada pelo que o seu assistente disse. Em 2025, a Deloitte aceitou devolver parte de um contrato de AU$ 440 mil com o governo da Austrália depois que um relatório feito com apoio de IA apareceu com referências acadêmicas inexistentes e uma citação inventada atribuída a um juiz. Nos dois casos, a IA não "quebrou". Ela fez exatamente o que modelos de linguagem fazem quando ninguém os impede: preencheu a lacuna com algo plausível.
Por que a IA inventa
Em setembro de 2025, a OpenAI publicou uma explicação direta: os modelos alucinam porque o treinamento e as avaliações recompensam o chute. Em um teste de múltipla escolha, chutar pode render ponto; deixar em branco garante zero. Quando o placar mede só acertos, o modelo aprende que arriscar compensa.
O exemplo publicado pela própria empresa mostra o efeito. Em um teste de perguntas factuais, dois modelos tiveram acurácia parecida, de 22% e 24%. O que mais admitia não saber errou em 26% das perguntas. O que quase nunca se abstinha errou em 75%.
Taxa de erro no teste SimpleQA, segundo a OpenAI (Why language models hallucinate, 05/09/2025). Os modelos são o gpt-5-thinking-mini e o o4-mini.
A lição para quem coloca IA em produção é simples: não basta medir quantas vezes o agente acerta. É preciso medir quantas vezes ele erra com confiança e dar a ele, explicitamente, a saída do "não sei".
Alucinação também é risco de segurança
O problema vai além de respostas erradas. Um estudo apresentado no USENIX Security 2025 analisou 576 mil amostras de código geradas por 16 modelos e verificou que, em média, pelo menos 5,2% dos pacotes de software citados pelos modelos comerciais e 21,7% dos citados pelos modelos de código aberto não existem, com mais de 205 mil nomes inventados diferentes. Segundo a Cloud Security Alliance, 43% desses nomes reapareceram em todas as dez repetições da mesma pergunta. Isso permite que um atacante registre o nome inventado com um pacote malicioso e espere alguém instalar.
A lista de riscos da OWASP para aplicações com modelos de linguagem, edição 2025, organiza o restante do terreno. Entre os dez itens estão a injeção de instruções, que é a primeira da lista, o vazamento de informações sensíveis, os agentes com permissão demais e a desinformação, categoria em que a OWASP inclui a alucinação.
Seis camadas que tornam um agente confiável
Nenhum modelo chega a zero erro. O objetivo realista é que o erro seja raro, seja percebido e não tenha consequência grave. Isso se constrói em camadas:
- Fontes aprovadas. O agente responde com base no conteúdo que a empresa aprovou, como políticas, catálogo e procedimentos, e não com o que "lembra" do treinamento.
- Permissão para não saber. As instruções dizem com clareza o que fazer quando a resposta não está nas fontes: admitir, perguntar ou passar para uma pessoa. Errar com confiança passa a ser medido como falha.
- Limite de ação. O agente só tem acesso ao que precisa, e ações com impacto, como reembolsos, publicações e alterações em sistemas, exigem aprovação humana.
- Verificação contínua. Uma bateria de perguntas difíceis roda a cada mudança, o código passa por testes e checagem de dependências, e nada entra em produção sem revisão.
- Proteção contra injeção. Instruções do sistema ficam separadas de tudo o que vem de fora, como mensagens de clientes, documentos e páginas da web, para que um texto malicioso não mude as regras do jogo.
- Rastreabilidade e dados protegidos. Cada resposta e cada ação ficam registradas, com acesso mínimo aos dados, conformidade com a LGPD e nada usado para treinar modelos.
Como saber se está funcionando
- Respostas sem fonte: quantas respostas não se apoiam em nenhum conteúdo aprovado. A meta é perto de zero.
- Abstenções corretas: quantas vezes o agente disse "não sei" ou chamou uma pessoa quando deveria.
- Tentativas barradas: quantas tentativas de injeção ou de tirar o agente do escopo foram recusadas.
- Encaminhamentos pertinentes: quanto do que foi passado para pessoas era mesmo caso de pessoa.
O assistente deste site segue essas regras: responde só com base no conteúdo publicado, não informa preços, não inventa clientes, recusa o que está fora do escopo e encaminha para a equipe quando é a hora. Você pode testar agora mesmo.
Perguntas rápidas
O que é alucinação de IA?
É quando um modelo de IA produz uma informação falsa com aparência de verdadeira, como uma política que não existe, uma citação inventada ou um pacote de software que não existe.
Dá para eliminar a alucinação?
Não totalmente, mas dá para torná-la rara, detectável e sem consequência grave: respostas apoiadas só em fontes aprovadas, permissão explícita para dizer não sei, limite de ação, verificação contínua e revisão humana no que importa.
O que é injeção de instruções?
É quando um texto vindo de fora, como a mensagem de um cliente, um documento ou uma página da web, contém ordens escondidas que tentam mudar o comportamento do agente. É o primeiro item da lista de riscos da OWASP para aplicações com IA.
Na prática
Fato Checado: teste de estresse para chatbots e agentes de IA
Descubra onde a sua IA inventa, vaza dados ou obedece a quem não deveria, antes que um cliente descubra.
Fontes
- Moffatt v. Air Canada: misrepresentation by an AI chatbot. McCarthy Tétrault, 2024.
- Deloitte to partially refund Australian government for report with apparent AI-generated errors. Associated Press, 07/10/2025.
- Why language models hallucinate. OpenAI, 05/09/2025.
- We Have a Package for You! A Comprehensive Analysis of Package Hallucinations by Code Generating LLMs. Spracklen et al., USENIX Security, 2025.
- Slopsquatting: AI Code Hallucinations Fuel Supply Chain Attacks. Cloud Security Alliance, 19/04/2026.
- OWASP Top 10 for LLM Applications 2025. OWASP GenAI Security Project, 2025.
Os dados foram conferidos nas fontes acima na data de publicação. Pesquisas citadas por veículos de imprensa estão indicadas com o nome do veículo.
