「在 AI 里排第一」 - 这个位置很稳,但每种语言、每个引擎各有一个
同一个问题问五遍:被最先提到的品牌在 81 % 的组合里没有变。问题不在稳定性,而在于根本不存在一个「第一名」。
81 %
在五次相同运行中第一名品牌保持不变的组合占比
简短的回答:第一名相当稳定,而这恰恰让「我们在 AI 里排第一」这句话变得有误导性。 把完全相同的问题问五遍,被最先提到的品牌在 81 % 的情况下不会变。但换一种语言、换一个引擎,它就不再是同一个品牌了。
1 位
品牌在两次运行之间位移的中位数 - 每两个就有一个纹丝不动
100
次运行,零失败:4 个行业 × 2 种语言 × 2 个引擎,各五遍
在网站主机上,Hostinger 在英语、法语和西班牙语里居首 - 而德语里是 IONOS,两个引擎都是。在支付上几乎处处是 Stripe,但西班牙语的 Gemini 给出 Redsys。在酒店预订上,同一天、同一种语言,Perplexity 把 Booking.com 放在最前,Gemini 放的是 Google Travel。
没有一个第一名。每种语言、每个引擎各有一个,而且没有任何东西保证它们彼此相像。
我们测了什么
自 8 月 23 日以来我们所有测量使用的同一个基准问题,每个组合连续问五遍。四个全球性行业,两种语言,两个会检索的助手。100 次运行,零失败。 两次运行之间什么都没变:行业没变,语言没变,引擎没变,日期也没变。开口说话的只有助手自身的随机性。
清洗要走在排序前面,这不是细节。 我们的提取器仍会放过一些并非公司名的片段。它们一旦落到第一位,就会制造出一种本属于我们、而非属于引擎的不稳定。因此我们只保留在多条回答中反复出现的名称,然后才排序。
第一名站得住
| 指标 | 原始 | 修正写法后 |
|---|---|---|
| 第一名品牌保持不变的组合 | 12/16(75 %) | 13/16(81 %) |
| 位次完全不动的品牌 | 50 % | 50 % |
| 单个品牌位移的中位数 | 1 位 | 1 位 |
| 观测到的最大位移 | 5 位 | 5 位 |
每两个品牌里就有一个,在每次重复提问时都稳坐同一位次。位移的中位数是 1 位。与常听到的说法相反,这个排序不是抽签。
我们最初算出 38 %,那个数字是错的:「small teams」「performance」这类片段占据了第一位。先清洗再排序得到 75 %,再把指同一家公司的「hubspot crm」与「hubspot」合并,得到 81 %。我们差点公布的那种不稳定,是我们自己的。
但第一名有八个,不是一个
| 行业 | Perplexity | Gemini |
|---|---|---|
| 支付(en 与 fr) | Stripe | Stripe |
| 酒店预订(en) | Booking.com | Google Travel |
| 酒店预订(fr) | Booking.com | Booking.com |
| 网站主机(en 与 fr) | Hostinger | Hostinger,英语除外 |
| CRM(en) | HubSpot | HubSpot |
| CRM(fr) | 没有稳定的头名 | 没有稳定的头名 |
而 8 月 24 日那次覆盖更多语言的测量把这张表延长了。在德语里,被最先提到的主机商既不是 Hostinger,也不是任何全球玩家,而是 IONOS - 两个引擎都如此。Perplexity 甚至直接写道「in mehreren Vergleichen auf Platz 1 bzw. Testsieger」。在西班牙语里,Gemini 在支付中带出 Redsys(西班牙的银行网络),称其「muy utilizada en el mercado español」。这两家公司在其他语言里都不见踪影。
一家德国主机商在德国是第一。在英语里它不存在。这两句话同时为真。
法语 CRM 这个例外
这是我们测量中唯一没有任何品牌守住第一名的组合。在 Gemini 上,同一个问题的五次运行给出三个不同的第一:Freshsales、HubSpot、monday。在 Perplexity 上,Pipedrive 与一个连公司都算不上的标签交替出现。
那里没有需要拉下马的王者,而这是一条商业信息:在这个市场,第一名的位置是空着的。别处则不然 - 支付里的 Stripe、英语主机里的 Hostinger,每一次运行都由同一家占着。
该怎么用
「我们在 ChatGPT 里排第一」不是假话,而是话没说完。
在哪种语言、哪个引擎、哪种问法下排第一?没有这三点,它无法被核验。
不要把一个市场的第一名搬到另一个市场。
在英语里领先,对德语什么也说明不了 - 那里可能由本国玩家占据这个位置,而且是在两个引擎上同时占据。
动手之前,先看这个位置守没守住。
如果每次运行回来的都是同一个品牌,第一名就是一堵墙;如果每次都换,像法语 CRM 那样,它就是敞开的。
一次运行确立不了名次。
一半的品牌纹丝不动,另一半会动 - 在我们的测量中最多动五位。名次要在多次重复中确认,而不是在一张截图里确认。
局限
重复部分只覆盖四个行业、两种语言、两个引擎。
跑鞋被排除:该行业的回答引用带编号的型号,被我们的提取器丢弃,于是得出一个算不上结果的结果。
扩展到德语和西班牙语的那张表来自 8 月 24 日的采集
,每个组合只有一次运行。它显示头名因语言而异,但由于没有重复,并未确立这些语言里的稳定性。
我们的提取器仍不完美
,即使修正之后,仍有一个片段留在某个组合的最前面。我们公布两套算法而不是一套,并点明剩下的问题。
这里的「第一」指的是在回答正文中被最先提到。
它不是引擎发布的排行榜,而只是它列举的顺序。我们不替它读出排座次的意图。
我们不向任何人承诺在 ChatGPT 答案中的位置 - 没有人能诚实地做出这种承诺。可以测量的是:按语言、按引擎、按所提的问题,你处在什么位置。哪怕答案是「位置已经有人了,而且不是你以为的那一位」。