跳到正文
Waseit
← 全部文章
AEOGEO

200条里错了134条,表达疑虑15次:被引用不等于被正确引用

两项大型研究测量了AI引擎的引用。超过六成不正确,31%存在来源问题,而语气的笃定从不减弱。这对一个品牌意味着什么。

超过60%

在1600次查询中不正确的引用比例,测试了八个引擎(Tow Center,2025年3月)

2026年9月5日9 分钟读完
本文目录
  1. 两项大型研究测量了什么
  2. 最糟的不是错误,而是那份笃定
  3. 通往虚无的链接
  4. 这对一个品牌意味着什么
  5. 这改变了什么

简短回答:AI的引用可以点到你的名字,同时把你说错。 已发表的测量关注的不是是否出现,而是被归属内容的准确性:一项1600次查询的研究中,超过六成的引用不正确;另一项覆盖3000多条回答的研究中,31%存在来源问题。因此有用的问题不只是「我被引用了吗」,而是「让我说的话是否属实,那个链接是否通往某处」。

31%

存在来源问题的回答比例:归属缺失、误导或错误(EBU与BBC,2025年10月)

134比15

ChatGPT识别错误的文章数,对比它表示疑虑的次数,基于200条回答

一个出错并且说出来的引擎,给你留了机会。一个笃定地出错的引擎不留:读者没有理由去核实。

两项大型研究测量了什么

第一项来自哥伦比亚大学的Tow Center for Digital Journalism,发表于2025年3月6日。方法简单且可复现:二十家发行方,每家随机抽取十篇文章,原样复制片段,再让八个回答引擎指认标题、原始发行方、日期与URL。合计1600次查询。总体而言,引擎对其中超过六成给出了错误答案。

错误引用,八个回答引擎,1600次查询(Tow Center,2025年3月6日)。此处列出的分引擎数字,是该研究明确给出的。
测量结果
八个引擎整体超过60%的回答不正确
Perplexity,样本中最好37%不正确
Grok-3,样本中最差94%不正确
Grok-3,通向错误页面的引用200条中154条

第二项范围更广,来自公共广播机构。2025年10月22日由欧洲广播联盟与BBC发布,由职业记者评估ChatGPT、Copilot、Gemini和Perplexity的3000多条回答,覆盖22个机构、18个国家和14种语言。其核心结论是:这一缺陷是系统性的,既不取决于语言,也不取决于市场,更不取决于某一个助手。

记者在3000多条回答中记录的缺陷,22家公共媒体,18个国家,14种语言(EBU与BBC,2025年10月22日)。
缺陷类型占回答的比例
至少一个重大问题45%
来源问题:归属缺失、误导或错误31%
严重的准确性问题:编造细节、过时信息20%
Gemini,存在重大问题的回答76%

最糟的不是错误,而是那份笃定

Tow Center的一个数字值得单独拎出来,因为它决定了其余的一切。ChatGPT在200篇中认错了134篇,而表示信心不足只有十五次。错误与疑虑并不相关:它在三分之二的情况下出错,却只在十三次中说出一次。

这就是「会犯错的来源」与「会误导的来源」之间的区别。一个迟疑的引擎给读者留下信号,因而留下核实的机会。一个断言的引擎什么都不留。对企业而言,这意味着一条错误的引用不会自行纠正:回答里没有任何东西促使任何人去怀疑它。

通往虚无的链接

另一项发现更为具体。Gemini与Grok-3超过半数的回答指向编造的或失效的URL。在Grok-3上,200条引用中有154条落到错误页面。这个引擎不只是归属错误:它编造出一个看起来像证据的地址。

EBU的研究在来源一侧描述了同样的机制:把从未提出过的主张归给某家编辑部,链接通向另一主题的文章或已消失的页面,有时甚至为一篇从未发表过的文章给出完整引用——媒体名、标题、日期。一个格式完好的引注,并不是一个真实的引注。

这对一个品牌意味着什么

这一推理可以直接迁移。如果一个引擎能把一句话归给并未写下它的编辑部,它也能把你的论点、你的价格或你的专长归给竞争对手;反过来,也能把你从未作出的承诺算到你头上。两种情形你都「被引用」了,而两种情形下,只统计引用次数的计数器都会显示一条好消息。

这正是单独看待可见度分数的局限,包括我们自己的分数。出现是必要条件,不是结果的度量。一条引用要用三个问题来读:我们是否被点名,归给我们的内容是否准确,给出的链接是否通向一个真实存在的页面。

  • 这些研究针对的是新闻,而非企业推荐。

    Tow Center的方法是追溯一段新闻摘录的出处;EBU的方法是让记者评估新闻类回答。归属的机制相同,但迁移到商业推荐是我们所做的推断,并非这些研究测量过的内容。

  • 它们出自2025年,而模型此后已经改变。

    Tow Center发表于2025年3月,EBU与BBC发表于2025年10月。所测版本已非今天提供的版本,两项测量都没有说明同样的方法在本月会得出什么。我们没有重做。

  • 八个引擎的平均值掩盖了巨大的差距。

    因引擎而异,错误率从37%到94%不等;整体的「超过60%」是被最差者抬高的平均值。用这一个数字去谈论某个特定引擎,属于误读。

  • 两项我们都没有复现。

    这是一所大学研究中心和一个公共媒体联合体发表的工作,我们在原始出处读到。它们不是我们的测量,我们也不将其呈现为我们的测量。

这改变了什么

读引用本身,而不只是计数器。

被点名与被准确描述是两种不同的结果。只统计出现次数的看板,无法把好消息与关于你的错误区分开。

检查链接是否存在。

你域名下一个被编造出来的地址看起来像证据,实际上不是。点开引擎给出的东西:在两个受测引擎中,半数回答通向一个失效页面。

留意归给你竞争对手的内容。

错误是双向的:你的论点可能被算到另一个名字头上,而只盯着自己的监测看不到这一点。

别指望引擎会自我怀疑。

它出错的次数远多于迟疑——200条回答中,134处错误对15次保留。语气的笃定,并不说明内容的准确。

常见问题

AI的引用会损害我的企业吗
会,而这正是可见度计数器所遗漏的。已发表的研究记录了被归给从未提出过这些说法的来源的主张,以及通向不存在页面的链接。迁移到品牌上,这意味着一条回答可能把并非你的价格、专长或承诺算到你头上,同时仍把你计为被引用。
哪个引擎引用得最准确
在2025年3月Tow Center的研究中,Perplexity以37%的错误率为样本中最好,Grok-3以94%为最差。有两点保留:这些版本已非今天提供的版本,而且37%的错误率依然很高。样本中没有一个引擎在通常意义上是可靠的。
如何核实AI关于我们说了什么
像客户那样提问,然后分三步阅读回答:你的名字是否出现,归给你的内容是否准确,给出的链接是否通向一个真实存在的页面。并且随时间重复测量,因为某一天的回答并不预示第二天。这正是我们的监测所做的,也是你可以手动做的。