跳到正文
Waseit
← 全部文章
AEOGEO

测量了 652 个信息源:AI 助手会因提问语言不同而阅读完全不同的页面

昨天:被推荐的品牌随语言而变。今天:为挑选它们而阅读的页面。被引用的 652 个域名中,90 % 只出现在一种语言里。

2026年8月24日10 分钟读完
本文目录
  1. 我们究竟测量了什么
  2. 第一个结果:三个引擎并不在玩同一个游戏
  3. 第二个结果:阅读清单几乎不重合
  4. 第三个结果:两个引擎彼此也不读同样的页面
  5. 这些信息源具体长什么样
  6. 改变做法的那个数字
  7. 如果你在多种语言的市场销售,这意味着什么
  8. 这次测量的局限

简短的回答:助手为作答而查阅的信息源,在不同语言之间几乎完全不同。在十种语言中被引用的 652 个域名里,有 589 个 - 即 90 % - 只出现在一种语言中。 652 个域名中,只有 1 个在至少八种语言里被引用。

这是昨天那次测量的直接延续。昨天我们证明了被推荐的名单会随语言改变,也把接下来唯一重要的问题留给了读者:那具体该怎么做?答案在信息源里。会检索的引擎不是凭记忆推荐的,它先读页面,再从中取出名字。知道是哪些页面,比知道它们存在有用得多。

被推荐的品牌与英语的重合度为 43-74 %。为挑选它们而阅读的信息源,重合度只有 2-9 %。相近的答案,来自几乎不相交的阅读。

我们究竟测量了什么

设计与昨天逐字相同,好让两次测量能够对照阅读:五个全球性行业 - CRM 软件跑鞋在线支付酒店预订网站主机 -,十种语言,三个助手,提问中不提及任何国家。只有一个变量在动:语言。任何变化都只能来自它。

新的地方在于记录的对象:不再是答案的正文,而是引擎声明自己查阅过的网址。150 条回答,采集于 2026-08-24。

第一个结果:三个引擎并不在玩同一个游戏

每个引擎 50 条回答。“可用信息源”指能读出域名的网址。
助手引用了信息源的回答每条回答的域名数
Perplexity50 / 5016.7
Gemini31 / 50,但网址被遮蔽仅标题
ChatGPT(API,不联网检索)0 / 500

通过 API 调用的 ChatGPT 不检索:它凭记忆作答,不查阅任何一个页面。这个零不是测量失败,而正是结果 - 它提醒我们,“助手”这个词底下并存着两种截然不同的机制。你今天发布的内容,无法影响一个什么都不读的回答。

Gemini 确实检索,但隐藏了地址:它的链接全都指向一个内部跳转域名。照单统计会让谷歌在所有语言里都显示为第一大信息源 - 那是格式造成的假象,不是事实。因此我们剔除了它们,改用唯一可用的字段:标题,其中带有域名。这是一种间接测量,我们也如此对待它。

第二个结果:阅读清单几乎不重合

在 Perplexity 上,各语言与英语的信息源重合度 - 即两种语言全部域名中共有域名所占的比例:

与英语的信息源重合度,以及带有国别标记(国家顶级域或语言子域)的域名比例。
语言被引用的域名与英语的重合度国别域名比例
英语72-1 %
德语825 %68 %
波兰语843 %58 %
葡萄牙语839 %51 %
日语782 %50 %
法语848 %38 %
韩语625 %29 %
西班牙语848 %26 %
中文677 %15 %
阿拉伯语797 %8 %

用另一条路径单独测量 Gemini,得到的是同一个量级:与英语的重合度为 5-17 %,其 279 个域名中有 82 % 只出现在一种语言里。两个引擎,两种提取方法,同一个结论 - 这正是我们敢于发表它的依据。

右边那一列值得停一下。英语才是例外,而不是常态:国别信息源占比,英语为 1 %,德语为 68 %,波兰语为 58 %。用英语提问,问的是一个没有国界的网络;用德语提问,问的是德国的网络。

第三个结果:两个引擎彼此也不读同样的页面

同一种语言、同一个问题、同一天,Perplexity 与 Gemini 共享的信息源只有 9 % 到 18 %。可见语言之间的差异并非特例,而是普遍规律。不存在一份决定你在助手中是否出现的页面清单。每个引擎、每种语言各有一份。

这些信息源具体长什么样

并不是人们想象中的国际比价网站。以昨天品牌差异最大的网站主机行业为例:

针对“最好的网站主机服务商有哪些?”被引用的域名,按提问语言划分(Perplexity,2026-08-24)。
语言被引用的信息源
英语pcmag.com, hostingstep.com, websiteplanet.com, techradar.com
德语fuer-gruender.de, heise.de, websitewissen.com, hostinger.com
波兰语jakwybrachosting.pl, rankinghostingow24.pl, rankinghost.pl, hostingi.net
日语lolipop.jp, value-domain.com, assirobo.com, crepas.co.jp
韩语temkit.kr, ko.wix.com, webhosting.gabia.com
阿拉伯语mouqarin.com, adviserhost.com, afddal.com, hostingarabi.com

反复出现的有四类,没有一类是全球性目录:为单一市场而建的本国比价站该国的科技媒体(德国的 heise.de、法国的 clubic.com、西班牙的 xataka.com)、本地内容平台(韩国的 blog.naver.com 与 brunch.co.kr、namu.wiki、中国的 cnblogs.com),以及论坛 - reddit.com 是整次测量中被引用最多的域名,出现在十种语言中的七种,并且在 Perplexity 和 Gemini 上都出现。中文的结果里,163.com、cnblogs.com、什么值得买等本地平台位居前列。

有一个例子会动摇常识:在波兰语中,助手引用了一篇发表在政治新闻网站财经版块的 CRM 对比文章。这不是噪声 - 那是一篇真实的排行文章,刊登在一个拥有大量本国读者的网站上。决定你是否出现的页面,未必属于你所在的行业。

改变做法的那个数字

在 834 次引用中,指向答案里被点名企业自家网站的只有 86 次。十次引用里有九次,是在你的网站之外谈论你。

在自己的网站上写文章,并不会让你被推荐。 这是与传统搜索优化的根本区别 - 在那里,你的域名是最主要的资产。而在这里,你的网站的作用是印证其他页面已经说过的话,而不是把它引发出来。

如果你在多种语言的市场销售,这意味着什么

用英语做的检测,测不到你的其他市场。

如果你的市场不是英语市场,它连你自己的市场也测不到:2 % 到 9 % 的共同信息源,等于是向另一批材料提了另一个问题。

被大型英文网站引用不会外溢。

在美国排行榜上的一个位置,对日语的回答几乎毫无分量 - 那里有一半信息源带 .jp 后缀。

目标是本国的,而且清单很短。

在一个行业、一种语言里,助手读的是几十个域名。它们可以被一一识别,其中不少是任何全球知名度战略都触及不到的小网站。

在翻译之前先核实。

在跑鞋这个行业,十种语言推荐的品牌完全一致。为这个行业翻译一场可见度活动,等于把预算花在一个并不存在的问题上。

不检索的引擎永远读不到你。

面对一个凭记忆作答的助手,唯一的变量是它训练时关于你已经写下了什么。这是一场更慢的博弈,靠现在发布内容补不回来。

这次测量的局限

我们把局限一并写出,因为没有前提说明的数字不算结果。仅仅一天、五个行业、十种语言:这是一张快照,而且助手并非确定性的 - 昨天我们测得,同一条英语提示词运行两次,重合度也只有 62-76 %。Gemini 的信息源是通过标题测得的,因为拿不到可读的网址;在阿拉伯语中它一个都没有给出。最后,我们测的是被“阅读”的内容,而不是“说服了它”的内容:被引用的页面未必就是把某个名字送进名单的那一页。这是两个不同的问题,我们不宣称回答了第二个。

我们不向任何人承诺在 ChatGPT 答案中的位置 - 没有人能诚实地做出这种承诺。可以测量的是:按语言、按引擎,你目前处在什么位置,以及助手读了什么才走到那里。

常见问题

AI 助手在所有语言中引用的是同样的信息源吗?
不是。在我们 2026 年 8 月 24 日的测量中,十种语言共引用了 652 个域名,其中 90 % 只出现在一种语言里,只有 1 个在至少八种语言中被引用。各语言与英语的信息源重合度,从日语的 2 % 到葡萄牙语的 9 %。
被英文网站引用,对我在其他语言中的可见度有帮助吗?
根据这次测量,帮助很小。各语言的信息源清单几乎互不相交,而英语是最特殊的一种:它只有 1 % 的信息源带国家顶级域,德语是 68 %,波兰语是 58 %。在英文网络上建立的权威并不会自动外溢。
助手会读哪类网站来推荐一家企业?
反复出现的有四类:为单一市场而建的本国比价站、该国的科技媒体、本地内容平台,以及论坛。Reddit 是我们整次测量中被引用最多的域名,出现在十种语言中的七种。
只靠我自己的网站,能让我被推荐吗?
不能。在测得的 834 次引用中,只有 86 次 - 即 10 % - 指向答案里被点名企业的自家网站。十次引用里有九次是第三方页面。你的网站印证其他页面已经在说的话,但不会把它引发出来。
为什么在你们的测量中 ChatGPT 不引用任何信息源?
因为通过其 API 调用且不启用联网检索工具时,它凭记忆作答,不查阅任何页面:50 条回答中有 0 条引用了信息源。这与每次提问都会检索的 Perplexity 是不同的机制。你今天发布的内容,无法影响一个未经阅读而生成的回答。