跳到正文
Waseit
← 全部文章
AEO测量

同一个问题换一种语言问:被提到的公司里,72% 只出现在其中一边

2026 年 8 月 15 日在六座城市,用法语、葡萄牙语和英语测的。用同一种语言再问一遍,能拿回 61% 的名字;换一种语言问,只剩 20%。

2026年8月15日8 分钟读完
本文目录
  1. 为什么单凭一个差异什么都证明不了
  2. 2026 年 8 月 15 日我们测了什么
  3. 这跟哪些引擎有关?
  4. 最清楚的一例:里昂的水管工
  5. 有别人看到过这个吗
  6. 为什么是现在,在法国
  7. 下结论之前我们核过的一个细节
  8. 这对你意味着什么
  9. 局限,照旧

今天早上,我们问 ChatGPT 贝洛奥里藏特最好的会计事务所是哪几家。用葡萄牙语问,它一个名字都没报:它反过来问我们 - 是个人还是企业?需要哪类服务?同一分钟,同一个问题用英语问,立刻就给了一份名单:PwC Brasil、Deloitte Brasil、EY Brasil、KPMG Brasil、Grant Thornton Brasil。

两个回答、一座城市、一个引擎、同一瞬间。哪一个描述的是贝洛奥里藏特的会计行业?更要紧的是:如果你是当地一家事务所,你会在这两份里的哪一份中找自己?

为什么单凭一个差异什么都证明不了

昨天我们发了一个对今天很不方便的测量:同一个问题、同一个引擎、隔二十四小时,给出的名单也不一样。引擎跟它自己都对不上。那么,说法语和英语有分歧,在不知道一个引擎跟自己分歧多大之前,等于什么都没说。

这就是这次测量的对照组,也是这篇文章真正的主题。每个问题都在每种语言里问了两遍,连着问。这两次重复给出的是噪声地板。跨语言的比较,只有高过这块地板才有意义。

没有这个对照组,我们就会把噪声当成语言效应发出去。

2026 年 8 月 15 日我们测了什么

六组「行当×城市」,在两个市场之间配对:里昂、南特、波尔多的水管工、会计和面包店;圣保罗、贝洛奥里藏特、库里蒂巴的同样三个行当。每个问题都用当地语言和英语各问两遍,问给三个助手 - 一共 72 条回答。这些问题就是付费检测里实际用的问题,不是为这篇文章现写的。

  • 同一种语言、把问题再问一遍:61% 的名字会回来。十个里六个。这就是噪声地板。
  • 换一种语言:20%。十个里两个。
  • 相差 41 个百分点。跨语言拉开的距离,远远大于把问题重问一遍。
  • 在总共被提到的 123 家公司里,两种语言都提到的有 35 家 - 而 88 家只出现在一种语言里,也就是 72%。

这跟哪些引擎有关?

总数掩盖了要害:这个效应在三个引擎身上并不一样。Perplexity 在重问时保住 69% 的名字,换语言时只剩 5%。Gemini 从 45% 降到 25%。在 ChatGPT 上,语言之间的差异跟噪声区分不开 - 但这个引擎报的本地企业实在太少,它那边的计算只建立在寥寥几个案例上:我们把这一点说出来,而不是把它算进去。

这个分野和我们十天来量到的一致:这个效应属于那些真的去网上找的引擎。凭记忆作答的引擎,在两种语言里答得差不多。而会去搜的引擎,按语言的不同并不去同一个地方找 - 于是带回来的东西也不同。

最清楚的一例:里昂的水管工

用法语问里昂最好的水管工,Perplexity 报的是 Plomberie Roche Lyon 和 Mb Plomberie。同一分钟用英语问:AS DEPANN、Abatir、APAMS Plomberie、Plomberie Paul。

这些并不是把本地企业顶掉的国际公司。两边都是里昂的水管工 - 只是不是同一批。而在同一时间,用法语重问一遍能拿回三分之二。同一个引擎、同一座城、同一个行当、同一瞬间:两份互不相交的真实水管工名单。

有别人看到过这个吗

有,而且值得说出来。厂商 Peec AI 在 2026 年 2 月 12 日发布了对自家数据的分析 - 一千多万个问题,以及 ChatGPT 在后台触发的两千万次检索:其中 43% 的检索是在英文网络上进行的,尽管提问用的是另一种语言。土耳其语最常转向英语(94%),西班牙语最少(66%),而任何非英语语言都没有低于 60%。要按它本来的分量来看:这是一家厂商就自家数据做的声明,没有公开方法论,也没有公开数据集,因此外部无法核验。但它描述的机制,恰恰就是我们的数字在结果这一端显现出来的那一个。

BrandGEO Global 在 2026 年 8 月 1 日发布了 7 月 10 日在巴黎做的一次测试:在财富管理领域,法语回答报的是法国本土的独立精品机构,英语回答报的是国际大型私人银行;有一家机构出现在四条法语回答中的三条里,而四条英语回答里一条都没有。分母就按来源自己给的:四个类别、每种语言一个问题、那天可用的四个引擎,以及在所有巴黎提示词上都失败的 ChatGPT。这是一个孤立的信号,不是一条序列 - 而这正是我们想用对照组补上的那个差别。

最后,做模型的一方自己写下了这一点。Anthropic 于 2026 年 7 月 24 日发布的 Claude Opus 5 技术说明里写着:「Claude is multilingual, typically responding in the same language as the user's input. Output quality varies by language.」输出质量因语言而异。这句话没有谈到被提及的公司 - 我们也不让它多说一个字。

为什么是现在,在法国

2026 年 7 月 22 日,谷歌在其法国博客上,由 Sébastien Missoffe 署名,宣布 AI 概览和搜索中的 AI 模式在法国上线,「自今日起在手机和电脑上,以及在 Android 和 iOS 的谷歌应用中」推出。法国的生成式界面只有三周的历史。法国商户就此提出的疑问并不算迟:他们问得正是时候。

下结论之前我们核过的一个细节

我们六个母语问题里有两个语法是错的:我们的模板按阳性做一致,于是写成了「les meilleurs boulangeries」和「os melhores padarias」。装着这些模板的那个文件自己就写着:一个写得不好的问题会得到更差的回答。如果这是真的,那这两例量的是一致性错误,不是语言。

于是我们把这两个问题按正确的一致重问了一遍,别的什么都没改:相差 4.4 个百分点,而把同一个问题重问一遍的重合度是 48%。这是噪声。那个说法没有被证实,这两例也没有被取消资格 - 而且我们没有改模板,因为一个读起来刺眼的错误,还不足以成为挪动全体客户测量口径的理由。

这对你意味着什么

用你客户的语言去测。

一个用英语去问助手、却拿来判断你在法国或巴西可见度的工具,量的不是你的市场:它量的是另一个市场,那里的竞争对手跟你的不是同一批。

别从一次英语测试里下结论。

不管是「我有曝光」还是「我这行谁都没被提」。你知道的只是英语怎么说你这座城。

如果你的客户有时会用英语找你,那就是两个场子,不是一个。

在南特,英语问题浮上来的是 PwC Nantes、Groupe Secob、Fiteco;法语问题浮上来的是 Cerfrance、Capeos、One Ace。一家事务所可能在一个场子里称雄,在另一个场子里完全不存在。

这些数字没有一个是在承诺排名。

在一件连把同一个问题重问一遍都会换掉十分之四名字的事情上,承诺位置就等于承诺一次抽签的结果。我们不做这种事。

局限,照旧

六组「行当×城市」、一个上午、三个助手:这是抽样,不是普查。我们比较的是每条回答里的前八个名字,也就是我们的抽取程序会保留的范围。名单是手工重读过的,账目也可以核:抽出来的 334 条字符串里,有 154 条不是公司名 - 是小标题、挑选标准、建议之类 - 另有 23 条是名录。剩下 157 个名字,其中 4 个在第二遍阅读时被剔除。存活下来的 153 种写法,在把同一家店的不同写法合并之后,指向 123 家不同的公司 - 若不合并,「Aquarius」和「Panificadora Aquarius」就会被算成库里蒂巴的两家面包店。

这番清理并没有偏袒我们的结论:它让结论更稳。在过滤之前,噪声地板会掉到 32%,差距只有 21 个百分点。正是把噪声去掉之后,差距才拉开的 - 而噪声本身,不说任何一种语言。