跳到正文
Waseit
← 全部文章
AEOGEO

换一种问法,名单就变了

用两种寻常的说法向同一个 AI 问同一件事,覆盖美国 13 座城市、15 个行业。重合的商家只有 11 %,47 % 的比较里没有任何一家重复。但在整个市场层面,被提及最多的 10 家里有 7 家没有变。

11 %

同一个 AI、两种问法下重合的商家

2026年9月16日8 分钟读完
本文目录
  1. 我们测了什么
  2. 问法几乎换掉整份名单
  3. 换引擎比换问法影响更大
  4. 留下来的是经常出现的名字
  5. 两个问题不会让 AI 用同样的方式说话
  6. 这项测量不能证明什么
  7. 这对你意味着什么

简短的回答:「芝加哥最好的水管工是哪几家?」和「列出芝加哥最受推荐的水管工并说明理由」并不会给出同一份名单。 同一个 AI、同一座城市、同一个行业,两种寻常的问法,重合的商家只有 11 %,而且 47 % 的比较里没有任何一家重复。第一个被提到的商家相同的情况占 18 %。

47 %

的比较没有任何一家重复

10 家中的 7 家

被提及最多的商家经得起换问法

只用一个问题做的体检,量的是一种问法,而不是你的可见度。经得起换问法的不是排名,而是反复出现。

我们测了什么

数据来自 2026 年 9 月 13 日采集的 Waseit 美国研究。每个格子(一个行业、一座城市)都收到 两个问题,分别问 ChatGPT 和 Gemini。第一个是「What are the best [行业] in [城市]? Give me a list with your recommendations.」,第二个是「List the most recommended [行业] in [城市] and explain why.」。这是问同一件事的两种寻常说法。

这里只保留在 13 座城市 测量的 15 个行业(酒店、餐厅和面包店除外,它们的名字常带城市名)。一共 780 条回答,每个 AI、每种问法 195 条。对每个格子、每个 AI,我们把第一个问题给出的商家名单与第二个问题的名单做比较,得到 305 组可用比较,即两种问法都至少提到一家商户的那些。

衡量方式很简单:两种问法一共提到的商家里,有多少是两边都提到的?目录站单独计数,混进名单里的建议性标题被剔除。

问法几乎换掉整份名单

在 305 组比较中,两种问法合计提到 3,108 个不同的商家名称。两边都出现的只有 370 个,即 12 %。按比较取平均,重合率为 11 %。而且 305 组里有 143 组 没有任何一家重复。

这也许是长度造成的:第二个问题要求解释,于是 AI 把篇幅花在解释而不是列名上。我们只保留每条回答中 前三家(在任何截断之前)重新测了一遍:重合率仍是 13 %,而且 61 % 的比较 在各自前三家里没有任何一家相同。这不是截断,是换了一批商家。

换引擎比换问法影响更大

作为对照,我们在问法完全相同的条件下比较两个 AI:重合率降到 2 %。换引擎对答案的改变比换问法更大。但量级是一样的:两种情况下名单的大部分都会变。

Waseit 美国研究,2026 年 9 月 13 日采集,13 座城市 15 个行业。「两种问法」是同一个 AI 的两个问题之间重合商家的平均比例;「两个 AI」是在相同问法下 ChatGPT 与 Gemini 之间的同一测量。
行业两种问法、同一个 AI没有任何一家重复的比较两个 AI、同一种问法
人力派遣公司32 %24 组中 6 组9 %
保险经纪17 %25 组中 7 组3 %
驾校17 %21 组中 8 组2 %
美发沙龙14 %17 组中 2 组2 %
律师13 %15 组中 6 组0 %
水管工12 %22 组中 8 组0 %
营销公司11 %25 组中 11 组3 %
汽车修理厂11 %25 组中 7 组0 %
会计师7 %24 组中 15 组3 %
婚礼摄影师7 %25 组中 13 组0 %
开锁公司6 %19 组中 12 组0 %
暖通空调承包商4 %19 组中 15 组0 %
房地产经纪人3 %16 组中 12 组1 %
牙医3 %12 组中 10 组1 %
电工3 %16 组中 11 组2 %

人力派遣是最稳定的行业:三分之一的商家名称经得起换问法,也是两个 AI 唯一稍有交集的行业(9 %)。另一端的牙医、电工、房地产和暖通空调,换个问法基本上就是另一份名单。

留下来的是经常出现的名字

如果结论止于此,那会让人泄气。但它并不止于此。在整个市场层面,换问法几乎什么也没改变:在所有城市和行业中 被提及最多的 10 家 里,7 家 在两个问题下都一样。Robert Half、Aerotek、Kforce、Insight Global、Randstad USA、HUB International 和 A1 Driving School 同时出现在两份榜单上。

另一个稳定的迹象:指向在至少三座城市出现过的名字的提及占比,在 两种问法下都是 20 %。问法改变的是谁出现在某一条回答里,而不是谁经常出现。

单独一条回答是一次抽签。

它取决于问法、引擎和格子。

反复出现才是信号。

一个在多种问法、多座城市里都回来的名字,不靠问题的偶然。

排名并不存在。

你所在城市、你所在行业并没有「那一个」AI 答案,有的是一个分布。

两个问题不会让 AI 用同样的方式说话

要求解释的问题会让名单变短。ChatGPT 从 每条回答 7.2 家降到 5.0 家,Gemini 从 4.1 家降到 3.1 家。至少提到一家商户的回答比例变化不大:ChatGPT 是 94 % 然后 90 %,Gemini 是 82 % 然后 84 %。

在 Gemini 那边,第二个问题常常给出一份标准清单而不是商家清单:第一个问题给出名字的位置,出现了「independent brokers」或「comprehensive service」这类标题。我们的清洗剔除了其中大部分,但不是全部。

这项测量不能证明什么

两种问法不是所有问法。

这是我们提的两个问题,不是你的客户实际输入内容的样本。真实差距可能更大,也可能更小。

回答长度影响了部分数字。

我们把输出限制在 ChatGPT 600 个 token、Gemini 1,400 个 token:第二个问题下,ChatGPT 的 195 条里有 48 条、Gemini 的 195 条里有 54 条在句子中间结束。因此每条回答的商家计数是下限。不过重合率在只看前三家时同样成立。

应用用户看到的内容。

这些回答来自 API;应用端可能加上网页搜索和其他设置。

只有一次采集。

一天,2026 年 9 月 13 日。这里没有测量逐日的波动,也没有测量同一问题问两次的差异。

完美的清洗。

建议性标题按规则剔除;漏网的部分会略微抬高不同名称的数量,两种问法都一样。

这对你意味着什么

不要用一个问题判断自己的可见度。

用客户的说法多问几次,看什么会回来。

不要为一次出现庆祝,也不要为一次缺席惊慌。

两者都在噪声里。

在不稳定的行业

(牙医、电工、房地产、暖通空调),下任何结论之前,先数一数在多种问法下出现的次数。

在稳定的行业

(人力派遣、保险、驾校),反复缺席才是真正的诊断。

我们的免费体检会向 ChatGPT 和 Gemini 提多个问题,数的是出现次数而不是名次。这是获得一个不取决于问题怎么写的数字的唯一办法。

常见问题

同一个问题的两种问法会给出同样的答案吗?
不会。在美国 13 座城市的 15 个行业中,向同一个 AI 提出的两种寻常问法平均只共享 11 % 的商家,47 % 的比较没有任何一家重复。第一个被提到的名字相同的情况占 18 %。
这只是因为第二个问题把字数花在解释上吗?
不是。只保留每条回答中截断之前的前三家,重合率仍为 13 %,而且 61 % 的比较在前三家里没有任何一家相同。是换了一批商家,而不仅仅是商家变少。
那么什么是稳定的?
被频繁提到的名字。在所有城市和行业中被提及最多的 10 家里,有 7 家在两种问法下相同。指向在至少三座城市出现过的名字的提及占比,两种情况都是 20 %。
这些数字基于多少条回答?
780 条回答,于 2026 年 9 月 13 日通过 ChatGPT 和 Gemini 的 API 采集,覆盖美国 13 座城市的 15 个行业,即每个 AI、每种问法 195 条,可用比较 305 组。