本文へ移動
Waseit
← 記事一覧
AEOGEO

200件中134件が誤り、表明された迷いは15回。引用されることは、正しく引用されることではない

二つの大規模な調査がAIの引用を測った。6割超が誤りで、31%に出典の問題があり、口調の自信は決して下がらない。それが企業にとって何を変えるか。

6割超

1,600件の問い合わせで誤っていた引用の割合。八つのエンジンを検証(Tow Center、2025年3月)

2026年9月5日9 分で読めます
この記事の目次
  1. 二つの大規模な調査が測ったもの
  2. 最悪なのは誤りではなく、その自信である
  3. どこにも通じない links
  4. 企業にとって何が変わるのか
  5. 何が変わるのか

短い答え。AIの引用は、あなたの名を挙げたうえで、あなたについて間違えることがある。 公開された計測が扱うのは登場することではなく、帰属された内容の正しさである。1,600件の問い合わせを用いた調査では6割超の引用が誤りであり、3,000件を超える回答を扱った別の調査では31%に出典の問題があった。したがって有用な問いは「引用されているか」だけではない。「言わされている内容は本当か、そしてその links はどこかへ通じているか」である。

31%

出典に問題があった回答の割合。帰属の欠落、誤解を招く帰属、誤った帰属(EBUとBBC、2025年10月)

134 対 15

ChatGPTが取り違えた記事の数と、迷いを示した回数。200件の回答について

間違えたうえでそう言うエンジンは、こちらに機会を残す。自信をもって間違えるエンジンは残さない。読み手に確かめる理由がないからだ。

二つの大規模な調査が測ったもの

ひとつめはコロンビア大学のTow Center for Digital Journalismによるもので、2025年3月6日に公表された。手順は単純で追試もできる。二十の発行元から各十本の記事を無作為に取り、抜粋をそのまま写し、八つの回答エンジンに見出し、元の発行元、日付、URLを特定させる。合計1,600件の問い合わせである。全体として、エンジンはその6割超に誤った答えを返した。

誤った引用。八つの回答エンジン、1,600件の問い合わせ(Tow Center、2025年3月6日)。ここに挙げたエンジン別の数値は、調査が明示しているものである。
計測結果
八つのエンジン全体6割超が誤った回答
Perplexity、この中で最良37%が誤り
Grok-3、この中で最悪94%が誤り
Grok-3、誤り画面に至った引用200件中154件

ふたつめはより広く、公共放送によるものだ。2025年10月22日に欧州放送連合がBBCとともに公表し、職業記者がChatGPT、Copilot、Gemini、Perplexityの回答3,000件超を、22の組織、18か国、14言語にわたって評価した。中心的な結論は、この欠陥が構造的だということである。言語にも、市場にも、特定のアシスタントにも依存しない。

記者が3,000件超の回答に認めた欠陥。22の公共放送、18か国、14言語(EBUとBBC、2025年10月22日)。
欠陥の種類回答に占める割合
少なくともひとつの重大な問題45%
出典の問題。帰属の欠落、誤解を招く帰属、誤った帰属31%
重大な正確性の問題。作られた細部、古い情報20%
Gemini、重大な問題を含む回答76%

最悪なのは誤りではなく、その自信である

Tow Centerの数字のひとつは切り出すに値する。それが残りすべてを決めるからだ。ChatGPTは200件中134件の記事を取り違え、確信の欠如を示したのは十五回にとどまった。誤りと迷いは連動していない。三分の二の場合に間違え、十三回に一回それを言う。

これは、誤りうる出典と、誤解させる出典との違いである。ためらうエンジンは読み手に合図を残し、したがって確かめる機会を残す。断言するエンジンは何も残さない。企業にとってこれは、誤った引用がひとりでに直らないことを意味する。回答のどこにも、それを疑うよう促すものがないからだ。

どこにも通じない links

もうひとつの所見はさらに具体的だ。GeminiとGrok-3の回答の半分超が、作られた、あるいは死んだURLを指していた。Grok-3では200件中154件の引用が誤り画面に行き着いた。このエンジンは帰属を誤るだけではない。証拠らしく見える住所を作り出している。

EBUの調査は出典の側で同じ仕組みを描いている。述べたことのない編集部に帰された主張、別の主題の記事や消えたページに通じる links、そして時には媒体名、見出し、日付までそろった完全な引用が、一度も出たことのない記事に対して与えられていた。整った形の出典表示は、正しい出典表示ではない。

企業にとって何が変わるのか

この理屈はそのまま移せる。ある文を書いていない編集部に帰することができるエンジンは、あなたの論拠、価格、専門を競合に帰することもできる。逆に、あなたがしたことのない約束をあなたに負わせることもできる。どちらの場合もあなたは「引用されている」し、どちらの場合も引用の数だけを数える計器は良い知らせを表示する。

これは、可視性の点数を単独で見ることの限界であり、私たちのものも例外ではない。登場することは必要条件であって、成果の尺度ではない。引用は三つの問いで読む。名指されているか、帰属された内容は正確か、示された links は実在するページに通じているか。

  • これらの調査は報道が対象であって、企業推奨ではない。

    Tow Centerの手順は報道の抜粋の出所をたどることであり、EBUの手順は記者に報道回答を評価させることである。帰属の仕組みは同じだが、商業的な推奨への移し替えは私たちのものであり、これらの研究が測ったものではない。

  • いずれも2025年のもので、モデルはその後変わっている。

    Tow Centerは2025年3月、EBUとBBCは2025年10月に公表した。検証された版はいま提供されている版ではなく、同じ手順を今月行えばどうなるかは、どちらの計測も語らない。私たちはそれを再実施していない。

  • 八つのエンジンの平均は、巨大な差を覆い隠す。

    エンジンにより誤りは37%から94%まで開く。全体の「6割超」は最悪の値が押し上げた平均であり、この一つの数字を特定のエンジンについて語るために引くのは読み違えである。

  • どちらも私たちは再現していない。

    これは大学の研究センターと公共放送の連合体が公表した仕事であり、出典にあたって読んだものである。私たちの計測ではなく、そう見せてもいない。

何が変わるのか

計器ではなく、引用そのものを読む。

名指されることと、よく描かれることは別の結果である。登場回数だけを数える指標盤は、良い知らせとあなたについての誤りを区別できない。

links が実在するか確かめる。

自社ドメイン上の作られた住所は、証拠のように見えて証拠ではない。エンジンが示すものを実際に開くこと。検証された二つのエンジンでは、回答の半分が死んだページに通じていた。

競合に何が帰されているかを見張る。

誤りは双方向に働く。あなたの論拠が別の名前の手柄になることがあり、それは自社だけを見る監視からは見えない。

エンジンの迷いを当てにしない。

迷うよりはるかに多く間違える。200件の回答で誤り134件に対し、留保は15件だった。口調の自信は、中身の正確さについて何も語らない。

よくある質問

AIの引用が自社の不利益になることはあるか
ある。そしてそれこそ可視性の計器が取り逃す点である。公開された調査は、述べたことのない出典に帰された主張と、実在しないページに通じる links を記録している。企業に移し替えれば、回答があなたのものでない価格、専門、約束をあなたに負わせながら、なおあなたを引用済みとして数えうる、ということだ。
最も正確に引用するエンジンはどれか
2025年3月のTow Centerの調査では、Perplexityが誤答37%で最良、Grok-3が94%で最悪だった。留保が二つある。これらの版はいま提供されている版ではないこと、そして37%の誤りは依然として高い比率であること。この検証の中に、通常の意味で信頼できるエンジンはなかった。
AIが自社について何を言っているか、どう確かめるか
顧客が尋ねるであろう形で問い、回答を三段階で読む。自社の名前が出るか、帰属された内容は正確か、示された links は実在するページに通じているか。そして時間をおいて繰り返すこと。ある日の回答は翌日の回答を予告しないからだ。私たちの追跡はそれを行っており、同じことは手作業でもできる。