同样的需求换个问法,推荐的企业就不同:重合率只有 31 %
「最好的 X」和「我这家十人公司该选哪个」的推荐名单只重合 31 %,而把完全相同的问题问两遍,重合率是 77 %。
简短的回答:改变问题里的「采购情境」,被推荐的企业就会改变 - 而且远比助手自身的随机性改变得更多。 把完全相同的问题问两遍,两份名单重合 77 %。把「最好的 X 有哪些」换成「我这家十人公司该选哪个」,只剩 31 %。
这比噪声底线低 46 个百分点。换句话说:你的买家如何措辞,对你是否出现的影响,比助手自己在两次回答之间的所有波动加起来还大。
一份只问一种问法的可见度审计,测的不是你的市场。它测的是你市场的四分之一。
为什么现在问这个
我们已经证明语言会改变推荐名单,被读取的信息源也随之改变,而这些信息源确实撑起了推荐。剩下的,是企业最不会怀疑的一个变量 - 因为它完全不受企业控制:客户是怎么说出自己需求的。
没有人只打「最好的 CRM」。买家也会说「我是个小团队」「哪个性价比最高」「我是新手,哪个最简单」。这是四个采购时刻,不是同一句话的四种说法。
我们究竟测了什么
五个全球性行业,两种语言(英语、法语),两个会检索的助手 - Perplexity 和 Gemini。120 次运行,零失败。 基准问题一字不改取自我们此前的测量,因此这次可以与之前的并排阅读。
| 意图 | 问法 |
|---|---|
| 基准 | 「最好的 X 有哪些?」 |
| 小公司 | 「我经营一家十人公司。你推荐我们用哪个 X?」 |
| 价格 | 「哪些 X 性价比最高?」 |
| 新手 | 「我完全是新手。哪些 X 最容易上手?」 |
噪声底线 - 没有它,这篇文章不成立
助手并非确定性的:把同一个问题再问一遍,它不会给出同一份名单。在不知道它自己有多前后不一致的情况下比较两种问法,等于把偶然当结果公布出去。
因此我们把基准问题在每个组合上跑了三遍,得到 46 对「同一个问题、两个回答」。它们的平均重合率 - 77 % - 就是底线。意图之间的任何差距都要对照它来读,绝不看绝对值。
结果
| 所提问题 | 重合率 | 与噪声的差距 |
|---|---|---|
| 同一个问题再问一遍(底线) | 77 % | - |
| 性价比最高的 | 53 % | 低 24 个百分点 |
| 我是新手 | 40 % | 低 37 个百分点 |
| 十人公司 | 31 % | 低 46 个百分点 |
两个引擎各自独立地朝同一方向变化 - 这正是我们敢于发表的依据。Perplexity 从 84 % 的底线降到「小公司」问题上的 39 %;Gemini 从 68 % 降到 23 %。数值不同,方向和幅度并无不同。
把它变具体的那个例子
在酒店预订上,助手自我重复得非常好:同一个问题跑两遍,重合率 86 %。加上一句「我经营一家十人公司」,重合率跌到 0 %。不是 30,不是 15,是零。没有一家企业是共同的。
看看名字就明白了:基准问题给出的是人人都知道的大众平台。「十人公司」这个问题带出了 TravelPerk、Engine、Booking.com for Business - 商务差旅领域的玩家,在第一份名单里根本没出现。这不是排名在动,而是另一个市场在回答。
随问题改变的不是你的名次,而是候选名单本身。
别处也是同样的模式:英语的网站主机领域,Namecheap 和 Wix 只出现在「小公司」「价格」「新手」这三个问题里。法语的 CRM 领域,HubSpot 在基准名单中缺席,但只要补上「小公司」或「我刚起步」,它立刻出现。
我们检验并否定了对立假设
如此干净的结果理应招来一个严肃的质疑,而我们把它冲着自己提了出来:我们的名称提取器会放过建议性片段(「检查一下集成」「最低预算」)。而关于价格的问题,产生的建议词汇与面向新手的问题并不相同。仅凭这种噪声,就可能凭空造出整个差距。
于是我们在四个清洗层级上重算了一遍,从原始到最严格 - 只保留在多个回答中反复出现的名称,因为真实的企业名会重复,而建议性表述往往只出现一次。噪声底线如预期从 62 % 升到 79 %。但差距在四种情形下都稳定在 29 到 36 个百分点之间。 这个质疑站不住脚;我们公布的是最严格的算法,不是最好看的那个。
该怎么做
列出客户的问题,而不是你的品类。
「最好的开票软件」是记者的问法。你的买家说的是「给非营利机构用的」「没有会计的情况下」「要开到国外的」。要测的正是这些句子。
在一种问法上的好成绩不会迁移。
46 个百分点的差距意味着:在通用问题上被推荐,几乎无法预测你真实细分市场那个问题的结果。
采购情境是杠杆,不只是风险。
如果你在通用名单里缺席,但你的细分市场有自己的问法,那就该在那里存在 - 而且那里的竞争要空旷得多。
让你的页面说清楚「你是为谁做的」。
那些把名字送进「十人公司」这个回答的信息源,正是明确讨论这种情形的页面。一个不说自己面向谁的页面,无法为某个特定画像而被选中。
局限
从测量中剔除了一个行业:跑鞋。
这个行业的回答引用带编号的型号(「Ghost 16」「Clifton 9」),而我们的提取器会丢弃它们。于是整个行业在各处都算出 0 % - 这是我们过滤器的副产物,不是结果。把它发表出来是不诚实的。
两种语言、两个引擎。
英语和法语;Perplexity 和 Gemini。通过 API 调用的 ChatGPT 被排除:我们测得它根本不检索,因此意图在那里不起同样的作用。
只有一天。
这些测量都带日期,而助手会变。正因如此,每个数字旁边都附有噪声底线。
我们的提取器仍不完美
,即使清洗之后:仍有少数表述(「技术支持」「法国中小企业」)残留在集合里。修正正在进行。我们说明这一点,是因为一个隐瞒了清洗过程的数字不算数字。
我们不向任何人承诺在 ChatGPT 答案中的位置 - 没有人能诚实地做出这种承诺。可以测量的是:按语言、按引擎,以及现在按所提的问题,你处在什么位置。