换一种问法,名单就变了
用两种寻常的说法向同一个 AI 问同一件事,覆盖美国 13 座城市、15 个行业。重合的商家只有 11 %,47 % 的比较里没有任何一家重复。但在整个市场层面,被提及最多的 10 家里有 7 家没有变。
11 %
同一个 AI、两种问法下重合的商家
简短的回答:「芝加哥最好的水管工是哪几家?」和「列出芝加哥最受推荐的水管工并说明理由」并不会给出同一份名单。 同一个 AI、同一座城市、同一个行业,两种寻常的问法,重合的商家只有 11 %,而且 47 % 的比较里没有任何一家重复。第一个被提到的商家相同的情况占 18 %。
47 %
的比较没有任何一家重复
10 家中的 7 家
被提及最多的商家经得起换问法
只用一个问题做的体检,量的是一种问法,而不是你的可见度。经得起换问法的不是排名,而是反复出现。
我们测了什么
数据来自 2026 年 9 月 13 日采集的 Waseit 美国研究。每个格子(一个行业、一座城市)都收到 两个问题,分别问 ChatGPT 和 Gemini。第一个是「What are the best [行业] in [城市]? Give me a list with your recommendations.」,第二个是「List the most recommended [行业] in [城市] and explain why.」。这是问同一件事的两种寻常说法。
这里只保留在 13 座城市 测量的 15 个行业(酒店、餐厅和面包店除外,它们的名字常带城市名)。一共 780 条回答,每个 AI、每种问法 195 条。对每个格子、每个 AI,我们把第一个问题给出的商家名单与第二个问题的名单做比较,得到 305 组可用比较,即两种问法都至少提到一家商户的那些。
衡量方式很简单:两种问法一共提到的商家里,有多少是两边都提到的?目录站单独计数,混进名单里的建议性标题被剔除。
问法几乎换掉整份名单
在 305 组比较中,两种问法合计提到 3,108 个不同的商家名称。两边都出现的只有 370 个,即 12 %。按比较取平均,重合率为 11 %。而且 305 组里有 143 组 没有任何一家重复。
这也许是长度造成的:第二个问题要求解释,于是 AI 把篇幅花在解释而不是列名上。我们只保留每条回答中 前三家(在任何截断之前)重新测了一遍:重合率仍是 13 %,而且 61 % 的比较 在各自前三家里没有任何一家相同。这不是截断,是换了一批商家。
换引擎比换问法影响更大
作为对照,我们在问法完全相同的条件下比较两个 AI:重合率降到 2 %。换引擎对答案的改变比换问法更大。但量级是一样的:两种情况下名单的大部分都会变。
| 行业 | 两种问法、同一个 AI | 没有任何一家重复的比较 | 两个 AI、同一种问法 |
|---|---|---|---|
| 人力派遣公司 | 32 % | 24 组中 6 组 | 9 % |
| 保险经纪 | 17 % | 25 组中 7 组 | 3 % |
| 驾校 | 17 % | 21 组中 8 组 | 2 % |
| 美发沙龙 | 14 % | 17 组中 2 组 | 2 % |
| 律师 | 13 % | 15 组中 6 组 | 0 % |
| 水管工 | 12 % | 22 组中 8 组 | 0 % |
| 营销公司 | 11 % | 25 组中 11 组 | 3 % |
| 汽车修理厂 | 11 % | 25 组中 7 组 | 0 % |
| 会计师 | 7 % | 24 组中 15 组 | 3 % |
| 婚礼摄影师 | 7 % | 25 组中 13 组 | 0 % |
| 开锁公司 | 6 % | 19 组中 12 组 | 0 % |
| 暖通空调承包商 | 4 % | 19 组中 15 组 | 0 % |
| 房地产经纪人 | 3 % | 16 组中 12 组 | 1 % |
| 牙医 | 3 % | 12 组中 10 组 | 1 % |
| 电工 | 3 % | 16 组中 11 组 | 2 % |
人力派遣是最稳定的行业:三分之一的商家名称经得起换问法,也是两个 AI 唯一稍有交集的行业(9 %)。另一端的牙医、电工、房地产和暖通空调,换个问法基本上就是另一份名单。
留下来的是经常出现的名字
如果结论止于此,那会让人泄气。但它并不止于此。在整个市场层面,换问法几乎什么也没改变:在所有城市和行业中 被提及最多的 10 家 里,7 家 在两个问题下都一样。Robert Half、Aerotek、Kforce、Insight Global、Randstad USA、HUB International 和 A1 Driving School 同时出现在两份榜单上。
另一个稳定的迹象:指向在至少三座城市出现过的名字的提及占比,在 两种问法下都是 20 %。问法改变的是谁出现在某一条回答里,而不是谁经常出现。
单独一条回答是一次抽签。
它取决于问法、引擎和格子。
反复出现才是信号。
一个在多种问法、多座城市里都回来的名字,不靠问题的偶然。
排名并不存在。
你所在城市、你所在行业并没有「那一个」AI 答案,有的是一个分布。
两个问题不会让 AI 用同样的方式说话
要求解释的问题会让名单变短。ChatGPT 从 每条回答 7.2 家降到 5.0 家,Gemini 从 4.1 家降到 3.1 家。至少提到一家商户的回答比例变化不大:ChatGPT 是 94 % 然后 90 %,Gemini 是 82 % 然后 84 %。
在 Gemini 那边,第二个问题常常给出一份标准清单而不是商家清单:第一个问题给出名字的位置,出现了「independent brokers」或「comprehensive service」这类标题。我们的清洗剔除了其中大部分,但不是全部。
这项测量不能证明什么
两种问法不是所有问法。
这是我们提的两个问题,不是你的客户实际输入内容的样本。真实差距可能更大,也可能更小。
回答长度影响了部分数字。
我们把输出限制在 ChatGPT 600 个 token、Gemini 1,400 个 token:第二个问题下,ChatGPT 的 195 条里有 48 条、Gemini 的 195 条里有 54 条在句子中间结束。因此每条回答的商家计数是下限。不过重合率在只看前三家时同样成立。
应用用户看到的内容。
这些回答来自 API;应用端可能加上网页搜索和其他设置。
只有一次采集。
一天,2026 年 9 月 13 日。这里没有测量逐日的波动,也没有测量同一问题问两次的差异。
完美的清洗。
建议性标题按规则剔除;漏网的部分会略微抬高不同名称的数量,两种问法都一样。
这对你意味着什么
不要用一个问题判断自己的可见度。
用客户的说法多问几次,看什么会回来。
不要为一次出现庆祝,也不要为一次缺席惊慌。
两者都在噪声里。
在不稳定的行业
(牙医、电工、房地产、暖通空调),下任何结论之前,先数一数在多种问法下出现的次数。
在稳定的行业
(人力派遣、保险、驾校),反复缺席才是真正的诊断。
我们的免费体检会向 ChatGPT 和 Gemini 提多个问题,数的是出现次数而不是名次。这是获得一个不取决于问题怎么写的数字的唯一办法。