134 réponses fausses sur 200, 15 doutes exprimés : être cité ne veut pas dire être bien cité
Deux grandes études mesurent les citations des moteurs d'IA. Plus de 60 % sont incorrectes, 31 % posent un problème de source, et l'assurance ne baisse jamais. Ce que cela change pour une marque.
plus de 60 %
des citations incorrectes sur 1 600 requêtes, huit moteurs testés (Tow Center, mars 2025)
Dans cet article
Réponse courte : une citation d'IA peut vous nommer et se tromper sur vous. Les mesures publiées ne portent pas sur le fait d'apparaître, mais sur l'exactitude de ce qui est attribué : plus de 60 % de citations incorrectes dans une étude de 1 600 requêtes, 31 % de problèmes de source dans une autre portant sur plus de 3 000 réponses. La question utile n'est donc pas seulement « suis-je cité », mais « ce qu'on me fait dire est-il vrai, et le lien mène-t-il quelque part ».
31 %
des réponses avec un problème de source - attribution manquante, trompeuse ou fausse (EBU et BBC, octobre 2025)
134 contre 15
les articles mal identifiés par ChatGPT, contre le nombre de fois où il a signalé un doute, sur 200 réponses
Un moteur qui se trompe et le dit vous laisse une chance. Un moteur qui se trompe avec aplomb ne la laisse pas : le lecteur n'a aucune raison d'aller vérifier.
Ce que deux grandes études ont mesuré
La première vient du Tow Center for Digital Journalism, à Columbia, publiée le 6 mars 2025. Le protocole est simple et reproductible : vingt éditeurs, dix articles tirés au hasard chez chacun, des extraits copiés tels quels, et huit moteurs de réponse à qui l'on demande d'identifier le titre, l'éditeur d'origine, la date et l'URL. Soit 1 600 requêtes. Collectivement, les moteurs ont rendu une réponse incorrecte à plus de 60 % d'entre elles.
| Mesure | Résultat |
|---|---|
| Ensemble des huit moteurs | plus de 60 % de réponses incorrectes |
| Perplexity, le meilleur du panel | 37 % incorrectes |
| Grok-3, le pire du panel | 94 % incorrectes |
| Grok-3, citations menant à une page d'erreur | 154 sur 200 |
La seconde est plus large et vient des médias de service public. Publiée le 22 octobre 2025 par l'Union européenne de radio-télévision avec la BBC, elle fait évaluer par des journalistes professionnels plus de 3 000 réponses de ChatGPT, Copilot, Gemini et Perplexity, dans 22 organisations, 18 pays et 14 langues. Sa conclusion centrale est que le défaut est systémique : il ne tient ni à la langue, ni au marché, ni à un assistant en particulier.
| Type de défaut | Part des réponses |
|---|---|
| Au moins un problème significatif | 45 % |
| Problème de source : attribution manquante, trompeuse ou fausse | 31 % |
| Problème d'exactitude majeur : détails inventés, information périmée | 20 % |
| Gemini, réponses avec un problème significatif | 76 % |
Le pire n'est pas l'erreur, c'est l'aplomb
Un chiffre du Tow Center mérite d'être isolé, parce qu'il décide de tout le reste. ChatGPT a mal identifié 134 articles sur 200, et n'a signalé un manque de confiance que quinze fois. L'erreur et le doute ne sont pas corrélés : le moteur se trompe dans deux tiers des cas et le dit dans un cas sur treize.
C'est la différence entre une source faillible et une source trompeuse. Un moteur qui hésite laisse au lecteur un signal, donc une chance de vérifier. Un moteur qui affirme ne laisse rien. Pour une entreprise, cela veut dire qu'une citation erronée ne se corrige pas toute seule : rien, dans la réponse, n'invite qui que ce soit à en douter.
Des liens qui ne mènent nulle part
L'autre constat est plus concret encore. Plus de la moitié des réponses de Gemini et de Grok-3 renvoyaient vers des URL fabriquées ou mortes. Chez Grok-3, 154 citations sur 200 aboutissaient à une page d'erreur. Le moteur ne se contente pas de mal attribuer : il invente une adresse qui a l'apparence d'une preuve.
L'étude de l'EBU décrit la même mécanique côté source : des affirmations attribuées à des rédactions qui ne les avaient jamais formulées, des liens menant à un article sur un autre sujet ou à une page disparue, et parfois une citation complète - nom du média, titre, date - pour un article qui n'a jamais existé. Une référence bien formée n'est pas une référence vraie.
Ce que cela change pour une marque
Le raisonnement se transpose directement. Si un moteur peut attribuer une phrase à une rédaction qui ne l'a pas écrite, il peut attribuer votre argument, votre tarif ou votre spécialité à un concurrent - ou l'inverse, vous prêter une promesse que vous n'avez jamais faite. Dans les deux cas vous êtes « cité », et dans les deux cas le compteur qui se contente de compter les citations affiche une bonne nouvelle.
C'est la limite d'un score de visibilité pris seul, la nôtre comprise. Apparaître est une condition nécessaire, ce n'est pas la mesure du résultat. Une citation se lit avec trois questions : sommes-nous nommés, ce qui nous est attribué est-il exact, et le lien proposé mène-t-il à une page qui existe.
Ces études portent sur l'actualité, pas sur des recommandations d'entreprises.
Le protocole du Tow Center consiste à retrouver l'origine d'un extrait de presse ; celui de l'EBU fait évaluer des réponses d'actualité par des journalistes. Le mécanisme de l'attribution est le même, la transposition aux recommandations commerciales est la nôtre et n'a pas été mesurée par ces travaux.
Elles datent de 2025, et les modèles ont changé depuis.
Le Tow Center a publié en mars 2025, l'EBU et la BBC en octobre 2025. Les versions testées ne sont plus celles servies aujourd'hui, et aucune de ces mesures ne dit ce que ferait le même protocole ce mois-ci. Nous ne l'avons pas refait.
Une moyenne à huit moteurs cache des écarts énormes.
Entre 37 % et 94 % d'erreurs selon le moteur, le « plus de 60 % » global est une moyenne où le pire élève l'ensemble. Citer ce seul chiffre pour parler d'un moteur en particulier serait une faute de lecture.
Nous n'avons reproduit aucune des deux.
Ce sont des travaux publiés par un centre de recherche universitaire et par un consortium de médias de service public, lus à la source. Ce ne sont pas nos mesures, et nous ne les présentons pas comme telles.
Ce que cela change
Lisez la citation, pas seulement le compteur.
Être nommé et être bien décrit sont deux résultats différents. Un tableau de bord qui ne compte que les apparitions ne peut pas distinguer une bonne nouvelle d'une erreur à votre sujet.
Vérifiez que le lien existe.
Une adresse inventée sur votre domaine ressemble à une preuve et n'en est pas. Cliquez sur ce que le moteur propose : la moitié des réponses de deux moteurs testés menaient à une page morte.
Surveillez ce qu'on attribue à vos concurrents.
L'erreur va dans les deux sens : votre argument peut être porté au crédit d'un autre nom, et c'est invisible depuis un suivi qui ne regarde que le vôtre.
Ne comptez pas sur le doute du moteur.
Il se trompe bien plus souvent qu'il n'hésite - 134 erreurs contre 15 réserves sur 200 réponses. L'assurance du ton ne dit rien de l'exactitude du fond.