你上了名单。然后客户问了第二个问题。
18 段对话,三个国家,每段两轮。到了助手必须选一个的时候,有三分之一的次数,它说出的公司名从未出现在它自己的名单里。
8 月 14 日,谷歌为搜索的 AI 模式换上了新模型:前一天发布的 Gemini 3.7 Flash。谷歌搜索产品副总裁罗比·斯坦用一句值得停下来看的话宣布了它 - 这个模型更善于遵循指令,也更懂意图。
在真实的对话里,意图不在第一个问题里。它在第二个问题里才变清晰。客户先问「波尔多最好的面包店是哪几家」,读完名单,再问他真正想知道的事 - 「哪一家做真正的天然酵母面包」。他是在这一轮做出选择的。
可是今年发表的所有 AI 可见度测量,都停在第一轮。数字被到处引用的 AirOps 报告《State of AI Search》 - 从一个回答到下一个回答仍然可见的品牌占 30 %,连续五次抽样后只剩 20 % - 测的也是同一个问题被反复提出。没有人测对话。今天早上,我们测了。
做法
六个案例,三个国家:里昂的水管工、波尔多的面包店、巴黎的劳动法律师、曼彻斯特的水管工、布里斯托的面包店、圣保罗的水管工。每个案例在同一段对话里走两轮:先问名单,把回答放回对话记录,再提出一个必须做决定的客户会问的问题,并附上「只给我一个名字」。三个助手 - ChatGPT、Gemini、Perplexity - 也就是18 段对话。所有名字都由人工重新清点。
ChatGPT 不做选择。它问你在哪里。
在第二轮里,ChatGPT 说出公司名字的次数是六次里零次。六次中有五次,它反过来提问:
- 「告诉我你的街区或邮编,我给你今天能上门的最好联系方式。」 - 里昂的漏水。
- 「你在波尔多的哪个区?」 - 天然酵母面包。
- 「您是劳方还是资方?」 - 巴黎的解雇。
- 「Do you mean Manchester, UK or Manchester, NH?」,接着是「Do you mean Bristol, UK?」 - 它连说的是哪座城市都不知道。
第六次,在圣保罗,它确实给了一个名字:Triider - 一个把你和师傅撮合起来的平台,不是师傅本身。
世界上使用最多的助手,在客户必须做选择的那一刻,谁也没有指。它问的是邮编。
上了名单,不等于进了决赛
Perplexity 是会拍板的:六次里六次都给出一个名字,而且只有一个。但六次里有三次,这个名字不在它自己第一轮的名单上。
里昂。
第一轮:Bilik、Les Bons Artisans、RingTwice、Yoojo、Travaux.com。第二轮:Accord Artisans - 此前从未提过。
曼彻斯特。
第一轮:Bee Heated MCR、AJ & RC Plumbing、SR Plumbing、JB Plumbing、About Town Plumbing。第二轮:Kang Plumbing - 此前从未提过。
圣保罗。
第一轮:Triider、GetNinjas、oHub、Encanador 24 Horas、Play Tec。第二轮:Assisty 24h - 此前从未提过。
把名单打散的,是急事
分界很干净,也不是碰巧。我们的六个第二问分成两类。三个问的是能不能马上来:今天必须有人上门。三个问的是质量:真正的天然酵母、proper sourdough、争一场解雇。
三个问能不能马上来的,都叫出了一个新名字。三个问质量的,都留住了名单里的名字 - 波尔多的 Maison Lamour、布里斯托的 Hart's Bakery、巴黎的 Kohen Avocats。
而且理由是引擎自己写的。关于 Accord Artisans:「他们宣称在里昂 30 分钟上门,全天候、每周七天」。关于 Kang Plumbing:「listed as open 24/7 in Manchester and says it offers immediate assistance」。赢下这一轮的不是名声,而是写在某处的一句话 - 说你现在联系得上。
Gemini 在自己的名单里选 - 律师除外
Gemini 六次里有三次说出了公司名,而且每一次都是自己名单上的名字:里昂的 Blicko、波尔多的 Le Blé en Herbe、布里斯托的 Farro Bakery。另外三次它把人引向了别处 - 在曼彻斯特引向自来水公司 United Utilities 和名录网站 Checkatrade,在圣保罗引向平台 GetNinjas。
在巴黎它拒绝了,而且写得清清楚楚:它受中立规则约束,不能把某一位专业人士挑出来放在别人之上。在受监管的行业里,第二轮可能根本没有赢家。
我们扔掉的一个数字
我们的自动提取一开始报出的存活率是各引擎 0 %、19 %、50 %。我们不发表它们:它们是错的。回头读那些名单就会发现,被数进去的「公司」有一部分根本不是公司 - 那是提取程序当成专有名词的建议句:「口碑仍然最管用」「核对注册号」「Red flags」「Dica de emergência」。
这是我们工具上的一个洞,而且并不局限于上周才打开的那几种文字:只要助手把一条建议加粗,法语和英语里同样会漏。我们把它写在这里,是因为给缺陷起个名字,比发表一个好看的百分比更有用。本文里的九个名字,是一个一个手工核对过的。
周一早上可以做什么
把你能提供服务的时间写全
,写在网站上,也写在各处的资料页里:营业时间、营业日、覆盖区域、上门时限。引擎为它那三个意外选择所引用的,正是这句话。
写清地址和所在街区。
ChatGPT 在第二轮提的六个问题里有五个关于位置。一个不知道你在哪里的助手,没法选你。
不要只测第一个回答。
出现在里面并不保证进决赛:我们观察到的选择里,有三分之一来自别处。
如果你的行业受监管
- 律师、医生、会计师 - 请预料到对方会拒绝指名。这时起作用的,是助手转而指向的官方名录。
照例说明局限,而且在这里局限很要紧:六个案例,三个国家,每个案例一个第二问,每个引擎一个模型,一个上午。急事与质量的分界,两边各只有三个案例 - 这是一个说得通、并且被引擎自己引用过的机制,不是定律。站得住的只有一句话:第一轮的名单不是入围名单。