三日たっても推薦リストはほとんど動かなかった - 6ポイント、質問を変えれば46ポイント
私たちは繰り返しの計測を売っている。だからこそ、リストが日ごとに動くのかを検証した。ほとんど動かず、片方のエンジンでは全く動かなかった。
短い答え:いつ聞くかはほとんど関係ない。どう聞くかがすべてを変える。 三日あけて同じ質問をすると重なりは70 %、数分あけて二度聞いた場合は76 %。差は6ポイントである。昨日の計測では、購買の文脈を変えるだけで46ポイントだった。
私たちは繰り返しの計測を売っている。「頻繁に測るべきだ」と結論づけるのは都合がよい。だからこそ、この問いは不都合な答えをあらかじめ受け入れる構えで、正しく立てる必要があった。
リストを動かすのは暦ではない。質問であり、エンジンである。
何を測ったか
8月23日以来、私たちのすべての計測が用いてきた同じ基準の質問 - 一字一句同一であることを、想定ではなく確認した。世界共通の4分野、2言語、検索する2つのアシスタント。本日60回の実行、失敗ゼロ。 これに、三日前の比較点として保存してあった8月24日の収集を合わせる。
ノイズ下限は依然としてこの記事を支える柱である。 アシスタントは数分の間隔ですでに自分と食い違う。二つの日の差は、偶然が数分のうちに生む差と照らし合わせるまで、何も意味しない。そこで本日も三回引き、一昨日の下限を持ち込まずにその日自身の下限を得た。
結果
| 二回の実行の間隔 | 整理後 | 生 |
|---|---|---|
| 同じ日、数分の間隔(下限) | 76 % | 61 % |
| 三日 | 70 % | 53 % |
| 下限との差 | 6ポイント | 8ポイント |
最も厳しい計算で6ポイント、生の計算で8ポイント。いずれにせよ、三日前のリストは、同じ一分のうちに引いた二つの結果と同じくらい今日のリストに似ている。
そしてここで、二つのエンジンは似ることをやめる
| エンジン | 同じ日 | 三日後 | 差 |
|---|---|---|---|
| Perplexity | 85 % | 71 % | 14ポイント |
| Gemini | 68 % | 69 % | なし |
Geminiはまったく動かない。 三日後のリストは、それ自身の連続した二つの回答と正確に同じ程度に今日のリストと似ている。これは安定ではない。連続する二回の実行ですでに68 %しか一致しないほど自分と食い違っており、三日にはもう付け加えるものが残っていないのである。
Perplexityはその逆だ。 短期ではよく再現し85 %、だからこそ本物の変化が見える - 三日で14ポイント。ここでは一週間おきに測ることに意味がある。ノイズが信号を飲み込まないからだ。
一方のエンジンでは「どのくらいの頻度で測るか」に答えがある。もう一方ではその問いが立たない。そこでは一回の実行がすでに何も意味しないからだ。
六対四十六
この数字は、同じ設計・同じ下限・同じ整理で得た昨日の数字と並べて初めて意味を持つ。
| 変えるもの | コスト(ポイント) |
|---|---|
| 尋ねる日(3日) | 6 |
| 価格を基準にする(「コスパが最もよいのは」) | 24 |
| 習熟度(「初心者です」) | 37 |
| 文脈(「10人の会社です」) | 46 |
七倍である。毎日同じ言い回しを繰り返す調査は、この主題のちょうど八分の一を、きわめて正確に測っている。計測の予算は、頻度よりも質問の多様性に置いたほうがよい。
自社の製品について、ここから引き出すこと
現段階で毎日計測する根拠はない。
三日間では差はノイズの内側に収まる。自社の数字が支えない頻度を売ることはしない。
単独の計測は依然として使い物にならない。
これは同じ結果の裏面である。連続する回答どうしで68 %しか重ならない以上、Geminiでの一回の実行は何も立証しない。繰り返しはノイズを黙らせるためのものであって、時事を追うためのものではない。
有用な頻度はエンジンによって異なる。
Perplexityでは三日で本物の変化が現れる。Geminiではまず複数回引かなければ、何を見ているのかすら分からない。
てこは質問の多様性である。
そこに46ポイントがあり、暦には6ポイントしかない。
限界、そして私たち自身が招いたデータの喪失
私たちは8月26日の自分たちのデータを破壊した。 分析用スクリプトが前日の収集スクリプトから関数を読み込んだが、その収集スクリプトはモジュール読み込み時に計測を実行し、自らの出力ファイルを上書きした。120回の実行が12件に減り、控えはなかった。この記事が載せるはずだった一日および二日の比較は、したがって計測不能である - 過ぎた日の計測はやり直せない。残るのはその日の下限と三日の差だけだ。読み込みが何も起動しないよう、防護を入れた。
時間上の二点であって、曲線ではない。
三日で6ポイントという事実は、一週間後や一か月後に変化がどう振る舞うかを何も語らない。外挿はしない。
4分野、2言語、2エンジン。
ランニングシューズは除外した。この分野の回答は番号付きの型番を挙げ、私たちの抽出器がそれを捨てるため、どこでも0 %になってしまう - フィルターの副産物であって結果ではない。
私たちの抽出器はなお不完全である。
だからこそ二段階の整理を並べて公表している。結論が両方で成り立つのでなければ、結論はない。
静かな時期は静かな時期にすぎない。
この三日間、検証した分野に大きな新製品も、公表されたモデル変更もなかった。静かな時期の小さな変化は、荒れた時期について何も約束しない。
私たちは誰にもChatGPTの回答での順位を約束しない - 誠実にそれができる者はいない。測れるのは、言語ごと、エンジンごと、尋ねられた質問ごとの現在地である。そして今回からは、時間がそれに何をするかについての手がかりも添えて。