引用された情報源は、本当に推薦の理由になっているのか - 128件を一つずつ検証
AIが参照したと述べたページを実際に読み、推薦されたブランドが載っているかを確かめました。128件中128件。中央値で6ページが各社に言及していました。
短い答え:はい。Perplexityが推薦した128社は、その128社すべてが、同社が参照したと申告したページの少なくとも1つに載っていました。 検証した12件の情報源のうち、中央値で6ページが当該ブランドに言及しています。引用は飾りではなく、実際に答えを支えています。
この記事があるのは、昨日の記事が私たち自身の書いた留保で終わっていたからです - 「私たちが測ったのは読まれたものであって、説得したものではない」。引用されたページが、名前を一覧に入れた当のページとは限りません。自分の留保を眠らせておけば、それは体裁のための一文に成り下がります。決着はつけられるので、つけました。
もし情報源が推薦を説明していないのなら、「どこで引用されるべきか」について三日間書いてきたことはすべて根拠のない助言になります。これは自分自身に対してこそ行うべき検証です。
何を測ったか
8月24日に収集した回答から出発します - 世界共通の5分野、質問に国名は一切含めません。各回答について二つのものがあります。本文(つまり推薦された企業)と、引用されたURLです。あとはそのページを読み、推薦された名前がそこにあるかを見るだけです。
すべてを左右する落とし穴があり、それは容赦がありません。 読み取れなかったページ - アクセス拒否、時間切れ、JavaScriptで組み立てられる内容 - があると、実際には裏づけのあるブランドが「裏づけなし」に見えてしまいます。それは記事で最も衝撃的な結果を、自分の収集失敗から捏造することにほかなりません。そこで三つの状態に分類しました。二つではありません。
| 状態 | 意味 |
|---|---|
| 裏づけあり | 引用ページの少なくとも1つにブランドが載っている |
| 裏づけなし | 引用ページをすべて読めたうえで、ブランドが載っていない |
| 判定不能 | 引用ページの少なくとも1つが読めなかった |
公表する比率は決着のついた事例だけで計算し、判定不能の割合は併記します - 引用された300ページのうち254ページが読め、85 %でした。私たちはロボットとして名乗り、ブラウザのふりはしません。ロボットを拒むサイトには拒む権利があり、それは「読めなかった」であって、事実ではありません。
結果
| 判定 | 件数 |
|---|---|
| 引用ページ1つ以上に裏づけあり | 128 |
| 裏づけなし | 0 |
| 判定不能(ページを読めず) | 6 |
| 決着した事例での比率 | 100 % |
しかも裏づけは薄くありません。推薦されたブランドの中央値は、検証した12ページのうち6ページに登場し、平均は5.9でした。語句の偶然の一致ではなく、収斂です。
たった1ページに支えられている9 %
128件中11件のブランドは、引用ページ「1つだけ」に支えられていました。 これはこの計測で最も実務に直結する数字で、二通りに読めます。
てことして: その場合、たった1ページで名前が回答に入りました。国内の比較サイト、業界紙の記事、現地プラットフォームの投稿 - 1ページあれば、その企業はアシスタントにとって存在します。情報源の戦略が念仏ではなく具体策になります。
もろさとして: 1ページだけに引用されているなら、あなたの存在はそのページ次第です。そのページの順位が変わる、消える、読まれなくなる - それだけで、あなたの側では何も変わっていないのに回答から消えます。
この結果が言わせてくれること、言わせてくれないこと
言わせてくれるのは、情報源のリストが本物のてこだということです。推薦は実際にエンジンが読んだものに支えられており、しかも - これが前日の計測でした - それらのページは国別で、数が少なく、分野と言語ごとに特定できます。ならば、そこに載る努力は症状ではなく原因に働きかけます。
言わせてくれないのは、ページに載れば推薦されるということです。私たちが示したのは「すべての推薦は情報源に支えられている」であって、「すべての情報源が推薦を生む」ではありません。引用ページは、エンジンが採用するよりはるかに多くの企業に言及しています。載ることは条件であって、通行証ではありません。
すべての推薦は、読まれたページに支えられている。読まれたページのすべてが推薦を生むわけではない。この二つを混同すれば、それは夢を売ることになります。
見つかった欠陥は、相手側ではなく私たちの側にありました
同じ計測が、私たちの道具の問題をあぶり出しました。名前の抽出器は200件を返しましたが、そのうち66件、つまり3分の1は企業名ではありませんでした - `Best overall: HubSpot CRM[2][3][4][6]` のように引用記号が貼りついたランキング見出しや、助言の書き出し(「ほとんどの人には」)です。
そこでこの66件を計算前に取り除きました。この記事が200ではなく128社と述べているのはそのためです。重要な点として、生の計測で「裏づけなし」となった5件はすべてこの種の副産物であり、根拠のない推薦は一つもありませんでした。修正は順番待ちです。ここで述べるのは、清掃を隠した数字は数字ではないからです。
限界
エンジンは1つだけ。
使えるURLを返すのは3つのうちPerplexityだけです。Geminiは自分のURLをリダイレクトの背後に隠し、API経由のChatGPTはそもそも検索しません。この結果は「検索するエンジン」について言えることで、「AI一般」についてではありません。
5言語のみ。
英語、フランス語、ポルトガル語、スペイン語、ドイツ語 - 私たちの名前抽出器が検証済みの言語です。日本語、韓国語、ポーランド語、アラビア語では今も見出しを返してしまいます。名前を取り違える抽出器で引用の正確さを測れば、雑音を結果として差し出すことになります。
たった1日
であり、アシスタントは決定論的ではありません。同じ英語プロンプトを2回実行しても重なりは62-76 %です。
存在は因果ではありません。
名前が引用ページにある - それは、そのページが決め手だったことの証明にはなりません。昨日の問いを狭めたのであって、解消したのではありません。
私たちは誰にもChatGPTの回答での順位を約束しません - 誠実にそれができる者はいません。測れるのは、言語ごと・エンジンごとの現在地と、その現在地がどのページに支えられているか、です。