跳到正文
Waseit
← 全部文章
AEOGEO

「在 AI 里排第一」 - 这个位置很稳,但每种语言、每个引擎各有一个

同一个问题问五遍:被最先提到的品牌在 81 % 的组合里没有变。问题不在稳定性,而在于根本不存在一个「第一名」。

81 %

在五次相同运行中第一名品牌保持不变的组合占比

2026年8月28日9 分钟读完
本文目录
  1. 我们测了什么
  2. 第一名站得住
  3. 但第一名有八个,不是一个
  4. 法语 CRM 这个例外
  5. 该怎么用
  6. 局限

简短的回答:第一名相当稳定,而这恰恰让「我们在 AI 里排第一」这句话变得有误导性。 把完全相同的问题问五遍,被最先提到的品牌在 81 % 的情况下不会变。但换一种语言、换一个引擎,它就不再是同一个品牌了。

1 位

品牌在两次运行之间位移的中位数 - 每两个就有一个纹丝不动

100

次运行,零失败:4 个行业 × 2 种语言 × 2 个引擎,各五遍

在网站主机上,Hostinger 在英语、法语和西班牙语里居首 - 而德语里是 IONOS,两个引擎都是。在支付上几乎处处是 Stripe,但西班牙语的 Gemini 给出 Redsys。在酒店预订上,同一天、同一种语言,Perplexity 把 Booking.com 放在最前,Gemini 放的是 Google Travel

没有一个第一名。每种语言、每个引擎各有一个,而且没有任何东西保证它们彼此相像。

我们测了什么

自 8 月 23 日以来我们所有测量使用的同一个基准问题,每个组合连续问五遍。四个全球性行业,两种语言,两个会检索的助手。100 次运行,零失败。 两次运行之间什么都没变:行业没变,语言没变,引擎没变,日期也没变。开口说话的只有助手自身的随机性。

清洗要走在排序前面,这不是细节。 我们的提取器仍会放过一些并非公司名的片段。它们一旦落到第一位,就会制造出一种本属于我们、而非属于引擎的不稳定。因此我们只保留在多条回答中反复出现的名称,然后才排序。

第一名站得住

每个组合五次相同运行,4 个行业 × 2 种语言 × 2 个引擎,2026-08-28。修正后的算法合并了同一品牌的两个写法,并剔除了一个并非品牌的片段;两个数字都公布。
指标原始修正写法后
第一名品牌保持不变的组合12/16(75 %)13/16(81 %)
位次完全不动的品牌50 %50 %
单个品牌位移的中位数1 位1 位
观测到的最大位移5 位5 位

每两个品牌里就有一个,在每次重复提问时都稳坐同一位次。位移的中位数是 1 位。与常听到的说法相反,这个排序不是抽签。

我们最初算出 38 %,那个数字是错的:「small teams」「performance」这类片段占据了第一位。先清洗再排序得到 75 %,再把指同一家公司的「hubspot crm」与「hubspot」合并,得到 81 %。我们差点公布的那种不稳定,是我们自己的。

但第一名有八个,不是一个

被最先提到的品牌,按行业、语言和引擎划分。这些列不是对同一件事的重复测量,而是不同的市场。
行业PerplexityGemini
支付(en 与 fr)StripeStripe
酒店预订(en)Booking.comGoogle Travel
酒店预订(fr)Booking.comBooking.com
网站主机(en 与 fr)HostingerHostinger,英语除外
CRM(en)HubSpotHubSpot
CRM(fr)没有稳定的头名没有稳定的头名

而 8 月 24 日那次覆盖更多语言的测量把这张表延长了。在德语里,被最先提到的主机商既不是 Hostinger,也不是任何全球玩家,而是 IONOS - 两个引擎都如此。Perplexity 甚至直接写道「in mehreren Vergleichen auf Platz 1 bzw. Testsieger」。在西班牙语里,Gemini 在支付中带出 Redsys(西班牙的银行网络),称其「muy utilizada en el mercado español」。这两家公司在其他语言里都不见踪影。

一家德国主机商在德国是第一。在英语里它不存在。这两句话同时为真。

法语 CRM 这个例外

这是我们测量中唯一没有任何品牌守住第一名的组合。在 Gemini 上,同一个问题的五次运行给出三个不同的第一:Freshsales、HubSpot、monday。在 Perplexity 上,Pipedrive 与一个连公司都算不上的标签交替出现。

那里没有需要拉下马的王者,而这是一条商业信息:在这个市场,第一名的位置是空着的。别处则不然 - 支付里的 Stripe、英语主机里的 Hostinger,每一次运行都由同一家占着。

该怎么用

「我们在 ChatGPT 里排第一」不是假话,而是话没说完。

在哪种语言、哪个引擎、哪种问法下排第一?没有这三点,它无法被核验。

不要把一个市场的第一名搬到另一个市场。

在英语里领先,对德语什么也说明不了 - 那里可能由本国玩家占据这个位置,而且是在两个引擎上同时占据。

动手之前,先看这个位置守没守住。

如果每次运行回来的都是同一个品牌,第一名就是一堵墙;如果每次都换,像法语 CRM 那样,它就是敞开的。

一次运行确立不了名次。

一半的品牌纹丝不动,另一半会动 - 在我们的测量中最多动五位。名次要在多次重复中确认,而不是在一张截图里确认。

局限

  • 重复部分只覆盖四个行业、两种语言、两个引擎。

    跑鞋被排除:该行业的回答引用带编号的型号,被我们的提取器丢弃,于是得出一个算不上结果的结果。

  • 扩展到德语和西班牙语的那张表来自 8 月 24 日的采集

    ,每个组合只有一次运行。它显示头名因语言而异,但由于没有重复,并未确立这些语言里的稳定性。

  • 我们的提取器仍不完美

    ,即使修正之后,仍有一个片段留在某个组合的最前面。我们公布两套算法而不是一套,并点明剩下的问题。

  • 这里的「第一」指的是在回答正文中被最先提到。

    它不是引擎发布的排行榜,而只是它列举的顺序。我们不替它读出排座次的意图。

我们不向任何人承诺在 ChatGPT 答案中的位置 - 没有人能诚实地做出这种承诺。可以测量的是:按语言、按引擎、按所提的问题,你处在什么位置。哪怕答案是「位置已经有人了,而且不是你以为的那一位」。

常见问题

可以说「我们在 ChatGPT 里排第一」吗?
不写明语言、引擎和问法就不可以。在我们 2026 年 8 月 28 日的测量中,被最先提到的品牌在五次重复里有 81 % 的情况保持不变,位置确实稳定;但换一种语言、换一个引擎,它就变了。网站主机里,英语是 Hostinger,德语是 IONOS。
AI 回答里品牌的排列顺序是随机的吗?
不是。在同一个问题的五次运行中,每两个品牌就有一个稳坐同一位次,位移的中位数是一位。观测到的最大值是五位。它不是抽签,但也不是固定的:名次要在多次重复中确认。
两个 AI 会给出同一个第一名吗?
并不总是。在英语的酒店预订上,同一天、同一个问题,Perplexity 最先提到 Booking.com,Gemini 最先提到 Google Travel。在支付上两者都认 Stripe。是否一致取决于行业。
怎么判断我所在市场的第一名有没有机会?
把同一个问题重复问几遍,看头名会不会换。如果每次回来的都是同一个品牌,位置就是守住的。在我们的测量中,法语 CRM 是唯一没有稳定头名的组合:五次运行给出多达三个不同的第一。
为什么把自己的数字从 38 % 改成 81 %?
因为第一次计算是先排序再清洗。「small teams」这类片段跑到了第一位,制造出源自我们提取器而非引擎的不稳定。只保留在多条回答中反复出现的名称,再合并同一品牌的两个写法,结果依次是 75 % 和 81 %。两个数字都公布。