跳到正文
Waseit
← 全部文章
AEOGEO

被引用的信息源真的能解释推荐吗?我们逐一核对了 128 家

我们读了 AI 声称查阅过的页面,并在其中寻找被推荐的品牌。128 家中的 128 家都找到了,中位数是六个页面提到每一家。

2026年8月25日9 分钟读完
本文目录
  1. 我们究竟测了什么
  2. 结果
  3. 那系于一个页面的百分之九
  4. 这个结果允许说什么,不允许说什么
  5. 发现的缺陷在我们这边,不在他们那边
  6. 局限

简短的回答:是。在 Perplexity 推荐的 128 家企业中,全部 128 家都出现在它声称查阅过的页面里的至少一个。 在所查验的十二个信息源中,中位数是六个页面提到该品牌。引用不是装饰,它确实撑起了这个答案。

这篇文章之所以存在,是因为昨天那篇结束在一句我们自己写下的保留意见上:「我们测的是被阅读的内容,而不是说服了它的内容」。被引用的页面未必就是把某个名字送进名单的那一页。让自己的保留意见睡着,它就变成了一句修辞。这件事可以查清,所以我们查清了。

如果信息源并不解释推荐,那么我们三天来关于「该去哪里被引用」写的一切都会是没有根据的建议。这种核查,最该做在自己身上。

我们究竟测了什么

我们从 8 月 24 日采集的回答出发 - 五个全球性行业,提问中不提及任何国家。每条回答我们都有两样东西:正文,也就是被推荐的企业;以及被引用的网址。剩下的事就是去读这些页面,看看被推荐的名字在不在里面。

有一个决定一切的陷阱,而且它很不留情。 一个读不到的页面 - 拒绝访问、超时、内容由 JavaScript 构建 - 会让一个其实有依据的品牌显示为「无依据」。那就等于用我们自己的采集失败,制造出这篇文章最耸动的结论。因此我们分成种状态,而不是两种:

第三种状态,正是测量与表演之间的分界。
状态含义
有依据品牌出现在至少一个被引用的页面中
无依据所有被引用的页面都已读取,其中没有该品牌
无法判定至少一个被引用的页面无法读取

公布的比例只在已判定的案例上计算,无法判定的比例并列公布:被引用的 300 个页面中有 254 个读取成功,即 85 %。我们以机器人的身份表明来意,不假扮浏览器 - 拒绝机器人的网站有权拒绝我们,那算作「无法读取」,而不是一个事实。

结果

取自 25 条回答(5 个行业 × 5 种语言)的 128 个企业名称,Perplexity,2026-08-25。
判定数量
至少一个被引用页面提供依据128
无依据0
无法判定(页面读不到)6
已判定案例中的比例100 %

而且这种支撑并不单薄。处于中位数的被推荐品牌出现在所查验十二个页面中的六个,平均为 5.9。这不是用词上的巧合,而是趋同。

那系于一个页面的百分之九

128 个品牌中有 11 个,只由「一个」被引用页面支撑。 这是本次测量中最具可操作性的数字,而且可以从两面来读。

作为杠杆: 在这些情形里,仅仅一个页面就足以把一个名字送进答案。一个本国比价站、一篇科技媒体报道、一篇本地平台上的文章 - 一个页面,这家企业对助手来说就存在了。这让信息源策略变得具体,而不是一句口号。

作为脆弱: 如果只有一个页面引用你,你的存在就系于它。那个页面排名变化、消失,或不再被读取 - 你就从答案里消失,而你这边什么都没有变。

这个结果允许说什么,不允许说什么

允许说:信息源清单是一个真实的杠杆。既然推荐确实由引擎读过的内容所承载,又既然 - 那是前一天的测量 - 这些页面是本国的、数量不多、并且可以按行业和语言逐一指认,那么努力出现在其中,作用的是原因而不是症状。

不允许说:出现在某个页面上就足以被推荐。我们证明了每一条推荐都有信息源支撑;我们没有证明每一个信息源都会产生推荐。被引用的页面提到的企业,远多于引擎最终保留的。出现在那里是条件,不是通行证。

每一条推荐都建立在一个被读过的页面上。并非每个被读过的页面都会产生推荐。把两者混为一谈,就是在卖幻觉。

发现的缺陷在我们这边,不在他们那边

同一次测量暴露了我们自己工具里的问题。我们的名称提取器返回了 200 条;其中 66 条,也就是三分之一,并不是企业名称 - 而是粘着引用标记的排行标题,例如 `Best overall: HubSpot CRM[2][3][4][6]`,或者建议的开场白(「对大多数人来说」)。

于是我们在计算前剔除了这 66 条,这正是本文谈 128 个品牌而不是 200 个的原因。一个要紧的细节:原始测量中仅有的五个「无依据」案例全部是这类副产物 - 没有一个是没有根据的推荐。修正已排入队列。我们在这里说明,是因为一个隐瞒了清洗过程的数字,不算数字。

局限

只有一个引擎。

三者之中只有 Perplexity 返回可用的网址。Gemini 把自己的网址藏在跳转背后,而通过 API 调用的 ChatGPT 根本不检索。这个结果适用于会检索的引擎,而不是泛指「AI」。

只有五种语言。

英语、法语、葡萄牙语、西班牙语、德语 - 也就是我们的名称提取器经过验证的语言。它在日语、韩语、波兰语和阿拉伯语中仍会返回小节标题;用一个连名字都认错的提取器去测引用的准确性,等于把噪声当结果端出来。

只有一天

,而且助手并非确定性的:同一条英语提示词运行两次,重合度也只有 62-76 %。

存在不等于成因。

名字出现在被引用的页面里 - 这并不能证明就是这一页决定了结果。我们收窄了昨天的问题,并没有把它消解。

我们不向任何人承诺在 ChatGPT 答案中的位置 - 没有人能诚实地做出这种承诺。可以测量的是:按语言、按引擎,你目前处在什么位置,以及这个位置建立在哪些页面之上。

常见问题

AI 助手真的会引用产生了它答案的信息源吗?
在我们 2026 年 8 月 25 日的测量中:是的。Perplexity 推荐的 128 家企业,全部出现在它声称查阅过的页面中的至少一个,在所查验的十二个页面中,中位数是六个提到它。没有发现任何没有根据的推荐。
出现在被引用的页面上,就足以被推荐吗?
不是,而且这个区别很重要。我们证明的是每一条推荐都建立在一个被读过的信息源上;我们没有证明反过来也成立。被引用的页面提到的企业远多于引擎最终保留的。出现在那里是条件,不是通行证。
被 AI 引用需要多少个页面?
在我们的测量中,处于中位数的品牌出现在所查验十二个页面中的六个。但 128 个品牌中有 11 个 - 也就是 9 % - 只由一个页面支撑。因此一个页面可能就够,但这同时也是一种脆弱:它一旦消失,这份存在也随之消失。
你们如何避免错误地断定某个信息源没有支撑某个品牌?
通过分成三种状态而不是两种。我们读不到的页面记为「无法判定」,绝不记为「无依据」 - 否则就是我们自己的采集失败在制造结论。公布的比例只覆盖已判定的案例,我们同时公布读取成功率:300 个页面中的 254 个,即 85 %。
这个测量适用于 ChatGPT 和 Gemini 吗?
不适用。它针对的是 Perplexity,三者中唯一返回可用网址的一个。Gemini 把自己的网址藏在内部跳转背后,而未启用联网检索工具、通过 API 调用的 ChatGPT 根本不查阅任何页面。这个结果适用于会检索的引擎。