跳到正文
Waseit
← 全部文章
AEO测量

同一个引擎,同一个问题:一旦允许它去搜,32 个名字里只剩 1 个

今天早上在四个行当上测的。这个结果逼我们改了自己的评分办法 - 没有去搜的引擎,不再投「不存在」这一票。

2026年8月10日7 分钟读完
本文目录
  1. 这对你的公司意味着什么
  2. 我们不得不改自己的评分
  3. 这个问题远不止我们这一家
  4. 明天早上做什么

有一个我们从来没做过的实验,结果让我们花了一周去改。只取一个助手 - Gemini。只问一个问题:「波尔多最好的水管工是谁?」模型不变,说法不变,日子也不变。只改一件事:答之前,准不准它去看谷歌。

2026 年 8 月 10 日今天早上做的,覆盖四座城市的四个行当:波尔多的水管、南特的牙科、图卢兹的修车行、斯特拉斯堡的高级餐厅。八个问题,一个引擎。结果是:凭记忆说出的公司名 32 个,去搜之后说出的公司名 32 个,而两份名单里共有的名字只有一个。百分之三。

这不是同一个回答的两个版本。这是两个不同的回答,签着同一个名。

这对你的公司意味着什么

两个回答的笃定语气一模一样。不联网时,Gemini 先说「一份依据客户评价和本地口碑、被经常推荐的波尔多水管工名单」,然后报名字。联网后,它先说「依据用户反馈和撮合平台的推荐」,然后报另一批名字。文字里没有任何地方告诉读者:它刚刚换了信息来源。

而你的客户用的是那个应用 - 会去搜的那个。如果你用一个不联网查询模型的工具来测自己的可见度,你测的是它的记忆:训练时记下、几个月前就冻住的东西。这是真实且有用的信息,知名度正是在那里衡量的 - 但它不是你的客户今天看到的东西。

我们不得不改自己的评分

这个区分对我们不是理论:它把我们的产品弄坏了。我们的免费检测会问两个引擎 - 一个上网搜,一个凭记忆答 - 而分数取的是两者的平均。算术上的后果是:一家被会搜的那个引擎排在第一位的公司,被不搜的那个引擎的沉默往下拖,最高也只能到 100 分里的 50 分。实际上会掉到 15 分或 30 分,报告上写着「可见度低」。

在此前的三周里,我们 74 次检测中有 56 次正好返回 0。一位用户用最简单的话点了出来:他的公司在 ChatGPT 应用里出现,而我们的工具给他打零分。他是对的,我们是错的。

规则在 8 月 9 日改了:只要至少有一个助手真的上网搜过,分数就只算这些助手。凭记忆作答的模型并没有为你的可见度作证 - 它那句「我不认识你」是未测量,不是零分。同一次检测,从前给出的是被封顶的分数,现在给出的是引擎真正找到的东西,而且每份报告都会点明:谁搜了,谁只是想起来。

这个问题远不止我们这一家

今天卖 AI 可见度测量工具的公司超过二十家,方法不同,同一个品牌得到的答案就不同。最常见的那条断层,正是我们刚刚量到的这一条:是去问模型的 API,还是去看用户在应用里看到的东西。两条路各有毛病 - API 会低估应用所知道的,而抓屏则会把一次个性化的会话当成常态,从而高估。

对你这个买工具的人来说,实际的后果是:问你的供应商,他们的测量是否经过联网搜索。如果他答不上来,或者这个问题让他不自在,那么他给的数字并不是你以为的意思。这不是好事者的技术问题 - 这是被提到的名字里 3% 和 100% 的区别。

明天早上做什么

  • 自己去验:在你客户真正会用的 ChatGPT 或 Gemini 应用里问一遍。这是唯一一个没人能跟你争的测量。
  • 要求任何一款 AI 可见度工具 - 包括我们的 - 告诉你哪些引擎搜了、哪些是凭记忆答的。不说的工具,是把两种测量混在了一起。
  • 两层都要做,因为赢法不一样:搜索这一层,赢在引擎回答那一刻会读的名录和评价;记忆那一层,靠时间赢,靠下一轮训练会吸进去的那些提及。
  • 我们的免费检测 60 秒问完助手,不用注册 - 从昨天起,它还会告诉你哪一个去搜了。

最后说一句,因为这种文章我们平时不发。承认一个卖测量的产品测得不对,并不好受,短期内对销售大概也不利。但我们卖的是诚实的测量:把一次方法上的更正藏起来,恰恰就是我们提醒读者要提防的那种行为。方法论是公开的,有日期,现在这条规则也白纸黑字写在上面。