被引用的信息源真的能解释推荐吗?我们逐一核对了 128 家
我们读了 AI 声称查阅过的页面,并在其中寻找被推荐的品牌。128 家中的 128 家都找到了,中位数是六个页面提到每一家。
简短的回答:是。在 Perplexity 推荐的 128 家企业中,全部 128 家都出现在它声称查阅过的页面里的至少一个。 在所查验的十二个信息源中,中位数是六个页面提到该品牌。引用不是装饰,它确实撑起了这个答案。
这篇文章之所以存在,是因为昨天那篇结束在一句我们自己写下的保留意见上:「我们测的是被阅读的内容,而不是说服了它的内容」。被引用的页面未必就是把某个名字送进名单的那一页。让自己的保留意见睡着,它就变成了一句修辞。这件事可以查清,所以我们查清了。
如果信息源并不解释推荐,那么我们三天来关于「该去哪里被引用」写的一切都会是没有根据的建议。这种核查,最该做在自己身上。
我们究竟测了什么
我们从 8 月 24 日采集的回答出发 - 五个全球性行业,提问中不提及任何国家。每条回答我们都有两样东西:正文,也就是被推荐的企业;以及被引用的网址。剩下的事就是去读这些页面,看看被推荐的名字在不在里面。
有一个决定一切的陷阱,而且它很不留情。 一个读不到的页面 - 拒绝访问、超时、内容由 JavaScript 构建 - 会让一个其实有依据的品牌显示为「无依据」。那就等于用我们自己的采集失败,制造出这篇文章最耸动的结论。因此我们分成三种状态,而不是两种:
| 状态 | 含义 |
|---|---|
| 有依据 | 品牌出现在至少一个被引用的页面中 |
| 无依据 | 所有被引用的页面都已读取,其中没有该品牌 |
| 无法判定 | 至少一个被引用的页面无法读取 |
公布的比例只在已判定的案例上计算,无法判定的比例并列公布:被引用的 300 个页面中有 254 个读取成功,即 85 %。我们以机器人的身份表明来意,不假扮浏览器 - 拒绝机器人的网站有权拒绝我们,那算作「无法读取」,而不是一个事实。
结果
| 判定 | 数量 |
|---|---|
| 至少一个被引用页面提供依据 | 128 |
| 无依据 | 0 |
| 无法判定(页面读不到) | 6 |
| 已判定案例中的比例 | 100 % |
而且这种支撑并不单薄。处于中位数的被推荐品牌出现在所查验十二个页面中的六个,平均为 5.9。这不是用词上的巧合,而是趋同。
那系于一个页面的百分之九
128 个品牌中有 11 个,只由「一个」被引用页面支撑。 这是本次测量中最具可操作性的数字,而且可以从两面来读。
作为杠杆: 在这些情形里,仅仅一个页面就足以把一个名字送进答案。一个本国比价站、一篇科技媒体报道、一篇本地平台上的文章 - 一个页面,这家企业对助手来说就存在了。这让信息源策略变得具体,而不是一句口号。
作为脆弱: 如果只有一个页面引用你,你的存在就系于它。那个页面排名变化、消失,或不再被读取 - 你就从答案里消失,而你这边什么都没有变。
这个结果允许说什么,不允许说什么
它允许说:信息源清单是一个真实的杠杆。既然推荐确实由引擎读过的内容所承载,又既然 - 那是前一天的测量 - 这些页面是本国的、数量不多、并且可以按行业和语言逐一指认,那么努力出现在其中,作用的是原因而不是症状。
它不允许说:出现在某个页面上就足以被推荐。我们证明了每一条推荐都有信息源支撑;我们没有证明每一个信息源都会产生推荐。被引用的页面提到的企业,远多于引擎最终保留的。出现在那里是条件,不是通行证。
每一条推荐都建立在一个被读过的页面上。并非每个被读过的页面都会产生推荐。把两者混为一谈,就是在卖幻觉。
发现的缺陷在我们这边,不在他们那边
同一次测量暴露了我们自己工具里的问题。我们的名称提取器返回了 200 条;其中 66 条,也就是三分之一,并不是企业名称 - 而是粘着引用标记的排行标题,例如 `Best overall: HubSpot CRM[2][3][4][6]`,或者建议的开场白(「对大多数人来说」)。
于是我们在计算前剔除了这 66 条,这正是本文谈 128 个品牌而不是 200 个的原因。一个要紧的细节:原始测量中仅有的五个「无依据」案例全部是这类副产物 - 没有一个是没有根据的推荐。修正已排入队列。我们在这里说明,是因为一个隐瞒了清洗过程的数字,不算数字。
局限
只有一个引擎。
三者之中只有 Perplexity 返回可用的网址。Gemini 把自己的网址藏在跳转背后,而通过 API 调用的 ChatGPT 根本不检索。这个结果适用于会检索的引擎,而不是泛指「AI」。
只有五种语言。
英语、法语、葡萄牙语、西班牙语、德语 - 也就是我们的名称提取器经过验证的语言。它在日语、韩语、波兰语和阿拉伯语中仍会返回小节标题;用一个连名字都认错的提取器去测引用的准确性,等于把噪声当结果端出来。
只有一天
,而且助手并非确定性的:同一条英语提示词运行两次,重合度也只有 62-76 %。
存在不等于成因。
名字出现在被引用的页面里 - 这并不能证明就是这一页决定了结果。我们收窄了昨天的问题,并没有把它消解。
我们不向任何人承诺在 ChatGPT 答案中的位置 - 没有人能诚实地做出这种承诺。可以测量的是:按语言、按引擎,你目前处在什么位置,以及这个位置建立在哪些页面之上。