134 respostas erradas em 200, 15 dúvidas expressas: ser citado não é ser bem citado
Dois grandes estudos mediram as citações dos motores de IA. Mais de 60% são incorretas, 31% têm problema de fonte, e a confiança nunca baixa. O que isso muda para uma marca.
mais de 60%
das citações incorretas em 1 600 perguntas, oito motores testados (Tow Center, março de 2025)
Neste artigo
Resposta curta: uma citação de IA pode nomeá-lo e errar sobre si. As medições publicadas não são sobre aparecer, mas sobre a exatidão do que é atribuído: mais de 60% de citações incorretas num estudo de 1 600 perguntas, 31% com problemas de fonte noutro que abrange mais de 3 000 respostas. A pergunta útil não é apenas « sou citado », mas « aquilo que me fazem dizer é verdade, e a ligação leva a algum lado ».
31%
das respostas com problema de fonte - atribuição em falta, enganadora ou errada (EBU e BBC, outubro de 2025)
134 contra 15
artigos mal identificados pelo ChatGPT, contra o número de vezes que assinalou uma dúvida, em 200 respostas
Um motor que erra e o diz deixa-lhe uma hipótese. Um motor que erra com aprumo não deixa nenhuma: o leitor não tem razão para ir verificar.
O que dois grandes estudos mediram
O primeiro vem do Tow Center for Digital Journalism, em Columbia, publicado a 6 de março de 2025. O protocolo é simples e reproduzível: vinte editores, dez artigos tirados ao acaso em cada um, excertos copiados tal e qual, e oito motores de resposta a quem se pede que identifiquem o título, o editor de origem, a data e o URL. São 1 600 perguntas. No conjunto, os motores deram resposta incorreta a mais de 60% delas.
| Medição | Resultado |
|---|---|
| Conjunto dos oito motores | mais de 60% de respostas incorretas |
| Perplexity, o melhor do painel | 37% incorretas |
| Grok-3, o pior do painel | 94% incorretas |
| Grok-3, citações que levam a uma página de erro | 154 em 200 |
O segundo é mais amplo e vem dos media de serviço público. Publicado a 22 de outubro de 2025 pela União Europeia de Radiodifusão com a BBC, fez jornalistas profissionais avaliarem mais de 3 000 respostas do ChatGPT, Copilot, Gemini e Perplexity, em 22 organizações, 18 países e 14 línguas. A conclusão central é que a falha é sistémica: não depende da língua, nem do mercado, nem de um assistente em particular.
| Tipo de defeito | Percentagem das respostas |
|---|---|
| Pelo menos um problema significativo | 45% |
| Problema de fonte: atribuição em falta, enganadora ou errada | 31% |
| Problema de exatidão grave: detalhes inventados, informação desatualizada | 20% |
| Gemini, respostas com um problema significativo | 76% |
O pior não é o erro, é o aprumo
Um número do Tow Center merece ser isolado, porque decide todo o resto. O ChatGPT identificou mal 134 artigos em 200, e assinalou falta de confiança apenas quinze vezes. Erro e dúvida não estão correlacionados: o motor erra em dois terços dos casos e di-lo num caso em treze.
É a diferença entre uma fonte falível e uma fonte enganadora. Um motor que hesita deixa ao leitor um sinal, e portanto uma hipótese de verificar. Um motor que afirma não deixa nada. Para uma empresa, isso significa que uma citação errada não se corrige sozinha: nada, na resposta, convida quem quer que seja a duvidar dela.
Ligações que não levam a lado nenhum
A outra constatação é ainda mais concreta. Mais de metade das respostas do Gemini e do Grok-3 remetiam para URL fabricados ou mortos. No Grok-3, 154 citações em 200 acabavam numa página de erro. O motor não se limita a atribuir mal: inventa um endereço com a aparência de prova.
O estudo da EBU descreve a mesma mecânica do lado da fonte: afirmações atribuídas a redações que nunca as tinham feito, ligações que levam a um artigo sobre outro assunto ou a uma página desaparecida, e por vezes uma citação completa - nome do meio, título, data - para um artigo que nunca existiu. Uma referência bem formada não é uma referência verdadeira.
O que isto muda para uma marca
O raciocínio transpõe-se diretamente. Se um motor pode atribuir uma frase a uma redação que não a escreveu, pode atribuir o seu argumento, o seu preço ou a sua especialidade a um concorrente - ou o inverso, imputar-lhe uma promessa que nunca fez. Nos dois casos está « citado », e nos dois casos o contador que se limita a contar citações mostra uma boa notícia.
É o limite de uma pontuação de visibilidade tomada isoladamente, a nossa incluída. Aparecer é uma condição necessária, não é a medida do resultado. Uma citação lê-se com três perguntas: somos nomeados, o que nos é atribuído é exato, e a ligação proposta leva a uma página que existe.
Estes estudos são sobre atualidade, não sobre recomendações de empresas.
O protocolo do Tow Center consiste em encontrar a origem de um excerto de imprensa; o da EBU faz jornalistas avaliarem respostas de atualidade. O mecanismo da atribuição é o mesmo, mas a transposição para recomendações comerciais é nossa e não foi medida por estes trabalhos.
Datam de 2025, e os modelos mudaram desde então.
O Tow Center publicou em março de 2025, a EBU e a BBC em outubro de 2025. As versões testadas já não são as servidas hoje, e nenhuma destas medições diz o que o mesmo protocolo daria este mês. Não o refizemos.
Uma média entre oito motores esconde diferenças enormes.
Entre 37% e 94% de erros consoante o motor, o « mais de 60% » global é uma média que o pior eleva. Citar esse único número para falar de um motor em particular seria um erro de leitura.
Não reproduzimos nenhum dos dois.
São trabalhos publicados por um centro de investigação universitário e por um consórcio de media de serviço público, lidos na fonte. Não são as nossas medições e não as apresentamos como tal.
O que isto muda
Leia a citação, não apenas o contador.
Ser nomeado e ser bem descrito são dois resultados diferentes. Um painel que só conta aparições não distingue uma boa notícia de um erro a seu respeito.
Verifique se a ligação existe.
Um endereço inventado no seu domínio parece uma prova e não é. Clique no que o motor propõe: metade das respostas de dois motores testados levava a uma página morta.
Vigie o que é atribuído aos seus concorrentes.
O erro corre nos dois sentidos: o seu argumento pode ser creditado a outro nome, e isso é invisível num acompanhamento que só olha para o seu.
Não conte com a dúvida do motor.
Erra muito mais vezes do que hesita - 134 erros contra 15 reservas em 200 respostas. A segurança do tom nada diz sobre a exatidão do conteúdo.