跳到正文
Waseit
← 全部文章
AEOGEO

三天过去,推荐名单几乎没动 - 6 个百分点,而换一种问法要 46 个

我们卖的是重复测量。所以我们检验了名单是否逐日漂移。几乎不漂移 - 而在其中一个引擎上,完全不漂移。

2026年8月27日9 分钟读完
本文目录
  1. 我们测了什么
  2. 结果
  3. 而在这里,两个引擎不再彼此相像
  4. 六比四十六
  5. 我们由此对自家产品得出的结论
  6. 局限,以及一次我们自己造成的数据丢失

简短的回答:你哪天问,几乎不改变什么;你怎么问,改变一切。 相隔三天,同一个问题的重合率是 70 %,而相隔几分钟的两次运行是 76 %。差六个百分点。昨天我们测得,仅仅换一个采购情境就要 46 个

我们卖的是重复测量。得出「必须经常测」的结论对我们最方便 - 正因如此,这个问题必须问得规矩,并预先接受那个令我们难堪的答案。

推动名单的不是日历,而是问题,以及引擎。

我们测了什么

自 8 月 23 日以来我们所有测量使用的同一个基准问题 - 一字不差,是核对过的,不是假定的。四个全球性行业,两种语言,两个会检索的助手。今天 60 次运行,零失败,再加上作为三天前比较点保存下来的 8 月 24 日采集。

噪声底线依然是支撑这篇文章的承重部件。 助手在相隔几分钟时就已经自相矛盾。两天之间的差异,在没有和「偶然在几分钟内造成的差异」相互对照之前,什么也说明不了。因此我们今天同样问了三遍,取得当天自己的底线,而不是把前天的搬过来。

结果

推荐名单的重合率。四个行业,英语与法语,Perplexity 与 Gemini,2026-08-27。「清洗后」只保留在多条回答中反复出现的名称;「原始」并列在旁,好让读者看清清洗改变了什么。
两次运行之间的间隔清洗后原始
同一天,相隔几分钟(底线)76 %61 %
三天70 %53 %
与底线的距离6 个百分点8 个百分点

最严格的算法下是 6 个百分点,原始算法下是 8 个。无论哪种,三天前的名单与今天的相似程度,大致等同于同一分钟内的两次运行。

而在这里,两个引擎不再彼此相像

同样的计算,逐个引擎来看。把两者平均,等于把其中一个的稳定性借给另一个。
引擎同一天三天后距离
Perplexity85 %71 %14 个百分点
Gemini68 %69 %没有

Gemini 完全不漂移。 三天之后,它的名单与今天的相似程度,恰好等同于它自己连续两条回答之间的相似程度。这不是稳定:而是它本来就与自己如此不一致 - 连续两次运行只有 68 % - 以致三天已经无从再添。

Perplexity 恰恰相反。 它短期内重复得很好,85 %,也正因如此真正的漂移才看得见:三天 14 个百分点。在它这里,隔一周测一次是有意义的,因为噪声不会淹没信号。

在一个引擎上,「该多久测一次」是有答案的。在另一个引擎上,这个问题根本立不住,因为在那里单次运行本身就毫无意义。

六比四十六

这个数字只有和昨天那个并排放着才有意义 - 同样的设计、同样的底线、同样的清洗。

什么在推动推荐名单,以低于噪声底线的百分点计。两次测量,连续两天,同一套方法。
你改变的东西代价(百分点)
提问的那一天(3 天)6
以价格为准(「性价比最高的」)24
熟练程度(「我是新手」)37
情境(「我这家十人公司」)46

七倍。一份每天重复同一种问法的审计,非常精确地测量了这个主题的八分之一。测量预算放在问题的多样性上,比放在频率上更划算。

我们由此对自家产品得出的结论

在现阶段,每天测量没有依据。

三天之内,差距仍落在噪声之内。我们不会去卖一个自家数字并不支持的频率。

单次测量依然不可用

,这是同一结果的另一面:连续两条回答只有 68 % 重合,那么在 Gemini 上跑一次什么也确立不了。重复是为了让噪声闭嘴,不是为了追时事。

有用的频率取决于引擎。

在 Perplexity 上,三天就能看出真实漂移;在 Gemini 上,你得先跑好几次,才知道自己在看什么。

杠杆是问题的多样性。

46 个百分点在那里,日历那边只有 6 个。

局限,以及一次我们自己造成的数据丢失

我们毁掉了自己 8 月 26 日的数据。 一个分析脚本从前一天的采集脚本里引入了一个函数;而那个采集脚本在模块加载时就会执行测量,并覆盖自己的输出文件。120 次运行被削减到 12 条,且没有副本。本文原本要包含的一天两天对比因此无法测量 - 过去某一天的测量是补不回来的。留下的只有当天的底线和三天的差距。我们已加上保护,使引入不再触发任何东西。

时间上的两个点,不是一条曲线。

三天 6 个百分点,并不能说明漂移在一周或一个月后如何表现。我们不作外推。

四个行业、两种语言、两个引擎。

跑鞋被排除:该行业的回答引用带编号的型号,而我们的提取器会丢弃它们,于是整个行业到处都算成 0 % - 这是过滤器的副产物,不是结果。

我们的提取器仍不完美。

所以两个清洗层级并列公布:结论在两者中都成立,否则就没有结论。

平静期终究只是平静期。

这三天里,受测行业没有重大发布,也没有公布的模型更换。平静时的微弱漂移,对动荡时什么也不保证。

我们不向任何人承诺在 ChatGPT 答案中的位置 - 没有人能诚实地做出这种承诺。可以测量的是:按语言、按引擎、按所提的问题,你处在什么位置。而从现在起,还多了一点关于时间会对它做什么的线索。

常见问题

我应该多久测量一次自己在 AI 中的可见度?
根据我们 2026 年 8 月 27 日的测量,比通常以为的要少。相隔三天,推荐名单的重合率是 70 %,而相隔几分钟的两次运行是 76 %:只差六个百分点。测量预算放在所提问题的多样性上,比放在频率上更划算。
AI 推荐的企业名单会逐日改变吗?
三天之内变化很小,而且取决于引擎。短期重复性好的 Perplexity(85 %)在三天里显示出 14 个百分点的真实漂移。Gemini 则毫无漂移 - 不是因为稳定,而是因为它与自己本就如此不一致(连续两条回答只有 68 %),三天已无从再添。
什么最能改变 AI 的推荐?
是问题,不是日历。改变采购情境 -「最好的 X 有哪些」对比「我这家十人公司该选哪个」- 会让重合率下降 46 个百分点;等上三天只降 6 个。这是连续两天、同一套设计测出的七比一。
做一次审计,够不够知道 AI 有没有推荐我?
不够。对同一个问题的连续两条回答,在 Gemini 上只有 68 % 重合,在 Perplexity 上是 85 %。单次运行分不清真实变化与当天的偶然。重复首先是为了让这种噪声闭嘴。
为什么要公布一个不利于「每天测量」的结果?
因为我们卖的正是重复测量,而一个为迎合卖方而挑出来的数字毫无价值。这个问题是按规矩问的,带噪声底线和两个清洗层级,答案则原样公布。