跳到正文
Waseit
← 全部文章
AEO测量

AI 的推荐会隔一天就变吗?

今天早上重新测了一次:8 月 6 日 AI 提到的 81 个名字里,8 日只有 15 个再次出现。什么撑得过 48 小时,什么会变,以及为什么。

2026年8月8日6 分钟读完
本文目录
  1. 今天早上到底测了什么
  2. 为什么留下的名字这么少
  3. 明天早上做什么

就在一年多前的 2025 年 8 月 7 日,OpenAI 一夜之间把 ChatGPT 的默认模型换成了 GPT-5。数百万用户眼看着回答的语气和内容同时变了样;反弹之大,让旧模型在 8 月 12 日又回到了付费订户手里。然后同样的事再来一次 - 2026 年 5 月 5 日,GPT-5.5 Instant 成为新的默认。一年之内两次,助手底下的引擎换了人。而那些被它点名、或者不再被点名的企业,事先什么消息都没有。

该担心吗?我们选择先测。今天早上,2026 年 8 月 8 日,我们把 8 月 6 日的四个问题一字不改地重新问了一遍 - 波尔多和里尔最好的水管工是谁,按客户真正会打的说法 - 问给同样的三个助手:ChatGPT、Gemini、Perplexity。重新收回十二条回答,跟周四那十二条对照。标题那个问题的答案是:会,而且变得厉害。周四出现的 81 个不同名字里,周六只有 15 个再次出现,而这十五个里还有两个是统计抓到的小标题,不是企业。大约每六个被提到的名字里,有一个撑过了 48 小时。AEO(Answer Engine Optimization,即存在于助手的回答之中)要正视的第一件事,就是这种不稳定。

今天早上到底测了什么

方法一句话就够:同样的问题、同样三个引擎、同样的模型、相隔 48 小时、两边各十二条回答、名字由我们报告所用的同一个解析器来数 - 所以任何差别都是回答在动,不是方法在动。真正的发现在于逐个引擎的明细。ChatGPT,走 API、不开联网搜索:26 个里留下 0 个。Gemini:29 个里留下 1 个 - 全国连锁的卫浴店 Espace Aubade。Perplexity,三者中唯一在回答当下读网页的引擎:28 个里留下 12 个。

周四被笃定说出的名字,周六没有再被说起 - 连当初提出它的那个引擎也没有。

最能说明问题的一例:周四,ChatGPT 向我们推荐了「Plomberie Lille Services」,还配上听起来很有把握的理由 - 这个名字我们没能对上任何一家可辨认的企业,当时就标注为未经证实。到了周六,它一次也不提了。写出它的那一方自己都不重复。它的拒答同样不稳定:周四四个问题拒了三个,周六四个里拒了两个。

为什么留下的名字这么少

因为稳定并不是「AI」的属性,而是它信息来源的属性。ChatGPT 凭记忆作答 - 这话是它自己在周六的回答里写的:「依据的是截至 2023 年可获得的评价与推荐」(我们的译文)。一份每次生成都要重新抽样的记忆,每抽一次就给出一份不同的名单。Perplexity 则在被问的当下重读名录:Bilik、ThreeBestRated 或 Travaux.com 这 48 小时里没有变,所以它的名字留了下来。再看看它这边留下来的东西的次序 - 先是名录和平台本身,然后才是它们排过序的师傅。你在 AI 里的可见度,稳定的那一层是写下来的来源,不是单次生成的那一次抽签。

再加上问题的规模:默认模型更换的那天 - 2025 年 8 月 7 日、2026 年 5 月 5 日 - 数千万用户的回答在同一天被重新分配。也就是说,你、你的对手、你的客户什么都没做,分数也可能动。所以孤零零的一张快照,好也罢坏也罢,几乎什么都说明不了;说话的是序列 - 一次次测量下来,你的名字回来的频率有多高,以及是哪些来源在托着它。

明天早上做什么

  • 不要从单次测量得出结论 - 不要因为一个零就慌,也不要因为一次好成绩就庆功。按固定间隔重测:有意义的是趋势,不是那个点。
  • 投在撑住了的那一层:会读网页的引擎所查阅的名录与平台。在我们的测量里,48 小时后仍被提到的师傅,全部来自那里。
  • 把默认模型更换的日期记下来(这些都是公开的)。如果你的可见度正好在更换那天发生变化,原因多半在你之上 - 而不在你的生意里面。
  • 把三个引擎分开测,免费,60 秒。然后下个月再测一次。产品是这个比较,而不是那张照片。

结尾照例说句老实话:四个问题、十二条回答、两座城市、一个行当 - 这是抽样,不是普查。但量级和我们三份全国研究已经显示的一致(三个引擎彼此吻合的名字只有 2% 到 3%),而且它有日期、已公开、可以重新核对。AI 的推荐是一次事件,不是一种状态。事件是管不住的 - 能管的是它出现的频率。