跳到正文
Waseit
← 全部文章
AEOGEO

门是开的,没人说在哪里

在十二个国家读取了 3,809 个企业网站:只有 37 个把回答引擎关在门外。缺口在别处。十个首页里有八个说明你是谁,只有三个说明你在哪里。

1.0%

的网站屏蔽回答引擎

2026年9月10日9 分钟读完
本文目录
  1. 我们测了什么,以及如何不靠我们自己重做一遍
  2. 门是开的,而这并不是好消息
  3. 缺的是地点
  4. 十二个国家,彼此并不一致
  5. 我们自己的工具教会了我们什么,以及我们差点发错了什么
  6. 三个免费的动作,按这个顺序

简短的回答:卖给您的那种恐惧是「被屏蔽」的恐惧,而它并不成立。在十二个国家读取的 3,809 个企业网站中,把回答引擎关在门外的有 37 个。三十七个。 问题在别处,而且更朴素:85.4% 的首页说明了您是谁,只有 30.2% 说明了您在哪里。回答引擎回答的是本地问题。没有地点,它就无从回答。

30.2%

在页面标题里写出所在城市

15.7%

通过全部三项检查

解除一个您从未屏蔽过的爬虫,什么也改变不了。把城市名写进页面标题,只需要三十秒。

我们测了什么,以及如何不靠我们自己重做一遍

2026 年 9 月 9 日和 10 日,我们读取了十二个国家的 3,809 个企业网站:诊所、医院、门店、代理机构。没有询问任何引擎,没有 API 密钥,没有花一分钱。每个站点两到三次公开的 HTTP 请求,任何人都能在浏览器里做到。

三项检查,一条原则:只测量企业自己能在三十秒内核实的东西。

回答引擎有权读取这个页面吗?

`robots.txt` 是否允许 OAI-SearchBot、ChatGPT-User、Claude-SearchBot、Claude-User、PerplexityBot 和 Perplexity-User。

机器知道您是谁、在哪里吗?

一个 `LocalBusiness` 或 `Organization` 类型的 `JSON-LD` 区块,包含名称、地址、电话和营业时间。

页面标题写出了字号和城市吗?

这是引擎最先读到的一行,是它始终显示的唯一一行,也是访客在浏览器标签页里看到的那一行。

门是开的,而这并不是好消息

必须把两类爬虫分开,混为一谈就会把测量变成稻草人。回答类爬虫在有人提问的那一刻去取页面:屏蔽它们,您就从回答里消失。训练类爬虫喂养模型:屏蔽它们是完全正当的企业决定,不会损失任何一次引用

3,809 个网站中有 37 个屏蔽回答类爬虫,即 1.0%。 另有 111 个屏蔽训练,占 2.9%,我们不把它算作缺陷。换句话说:一百次里有九十九次,市场提议为您解锁的那扇门,从来就没有关上过。

被屏蔽的训练类爬虫,基于在十二个国家读取的 3,809 个网站。屏蔽训练是正当选择:不会损失任何引用。
爬虫屏蔽它的网站占比
GPTBot992.6%
CCBot922.4%
ClaudeBot872.3%
Google-Extended802.1%
Applebot-Extended772.0%

缺的是地点

85.4% 的首页在标题里写出字号。30.2% 写出城市。 这五十五个百分点的差距,就是本文的全部主题。

回答引擎几乎从不回答「这是什么公司」。它回答的是「鲁昂的牙医」「克拉科夫的房产中介」「日内瓦的会计师」。要把您放进那条回答里,它必须把两样东西连起来:一个名字和一个地点。报出名字是底线,十家里有八家做到了。说明所在地几乎无人做到,而这恰恰是问题所要的。

结构化区块出现在 45.9% 的网站上。比标题里的城市名好,但仍然不到一半。总计 15.7% 通过全部三项检查,41.6% 只通过一项。

十二个国家,彼此并不一致

市场之间的差距是本次测量中最鲜明的结果,它既不跟随财富,也不跟随数字化成熟度。它跟随的是写作习惯。

回答引擎能读到什么,按市场划分。至少 40 个站点的十一个市场,2026 年 9 月 9 日和 10 日读取。其余 35 个站点(其中 33 个在美国)因样本不足不列入表内。
市场读取站点数三项全过机器可读身份标题含城市回答爬虫被屏蔽
阿拉伯联合酋长国23932.2%58.6%43.5%0.0%
英国40228.4%52.7%48.5%1.7%
新加坡34623.4%45.7%39.0%0.9%
波兰48718.1%48.7%33.7%0.8%
瑞士49517.6%46.5%34.5%0.8%
法国29017.2%54.8%30.0%0.3%
巴西3468.7%36.7%17.6%1.2%
比利时3828.6%38.5%23.8%1.8%
卡塔尔2766.2%38.8%12.3%0.7%
沙特阿拉伯2912.4%41.2%4.1%0.7%
日本2200.9%41.8%1.8%0.0%

日本是极端的例子:220 个站点里只有 4 个在标题中写出所在城市。 然而那里有 41.8% 发布了结构化区块,与比利时或卡塔尔相当。技术是有的,缺的是一句话。沙特阿拉伯同理,为 4.1%。

另一端,酋长国和英国居于表格前列,原因并不神秘:那里的页面标题本来就写得像一条广告——字号、行业、城市。这不是技术领先,而是写作惯例。

我们自己的工具教会了我们什么,以及我们差点发错了什么

这次测量的第一版把日本标注为 0.9% 的标题写出城市,沙特阿拉伯为 3.8%。数字是错的,责任在我们。

我们的标题读取器在非拉丁字符处把文本切成词。在「京都デンタルクリニック」上它一个词也切不出来,于是无法比较,于是回答「标题没有写出城市」。这不是对那些页面的观察:这是从我们自己读不懂它们这一事实推出的结论,却以测量的口吻说出。日语、阿拉伯语、韩语、中文、俄语、希腊语和泰语都掉进了同一个坑。

我们修好了它——这些文字书写时词与词之间没有空格,对它们有意义的比较是「是否包含」,而不是切分词的相等——然后重新读取了受影响的 346 个站点。结果是印证了这个发现,而不是抹掉它:日本从 0.9% 变为 1.8%,沙特阿拉伯从 3.8% 变为 4.1%。这个缺口真实存在,只是被我们的工具夸大了。

我们给这项检查加了第三种状态。当字号在我们的数据里是日文、而页面标题是罗马字时,两者无法比较:回答「否」是冤枉,回答「是」是奉承。于是检查返回无法测量,那一行从报告中消失,而不是凭空造出一个判断。这涉及 25 个站点,占 0.7%。

一次冤枉人的测量比不测量更糟:它让您失去的不是错的那一行,而是那些原本正确的行。

三个免费的动作,按这个顺序

顺序很重要:第一个动作决定另外两个,而如果第一个没做,第三个就毫无意义。

检查一次 `robots.txt`,然后忘掉它。

打开 `您的网站/robots.txt`。如果在 `User-agent: *` 下面看不到 `Disallow: /`,门就是开的,没有什么要做。一百个站点里有九十九个是这种情况,而这正是市场向您收费的那个动作。

把城市写进首页标题。

「杜邦诊所」变成「杜邦诊所,鲁昂的牙医」。这是引擎最先读到的一行,是它始终显示的唯一一行,而十家企业里有七家没有用上它。三十秒。

发布一个 `LocalBusiness` 结构化区块。

名称、通信地址、电话、营业时间。不到一半的网站有。这是引擎用来知道您是谁、在哪里而不必猜测的那一层。

这三个动作都不是买来的。三个都能在浏览器里、在您自己的网站上、不靠我们地核实。

常见问题

要出现在 ChatGPT 里,必须解除对 GPTBot 的屏蔽吗?
不必,这是最常见的混淆。GPTBot 用于模型训练;在有人提问的那一刻去取您页面的爬虫叫 OAI-SearchBot 或 ChatGPT-User。屏蔽训练不会损失任何引用。在我们的测量中,2.9% 的网站屏蔽训练,只有 1.0% 屏蔽回答引擎。
真正屏蔽 AI 回答引擎的网站有多少?
在我们 2026 年 9 月 9 日和 10 日对十二个国家的读取中,3,809 个里有 37 个,即 1.0%。因此屏蔽对一百家企业中的一家是真问题,对另外九十九家只是一句销售话术。
为什么标题里的城市这么重要?
因为回答引擎几乎总是在回答本地问题:「鲁昂的牙医」,而不是「这家诊所是什么」。要把您放进那条回答,它必须把名字和地点连起来。85.4% 的页面写出字号,30.2% 写出城市:起决定作用的是后一个数字。
这些数字适用于我所在的国家吗?
市场之间差距很大,值得一看:从阿拉伯联合酋长国(32.2% 全过)到日本(0.9%),比例是一比三十五。原因不是技术——日本发布的结构化区块和比利时一样多——而在于页面标题的写作惯例。
我能自己重做这次测量吗?
能,完整地做,而且不需要我们。打开 您的网站/robots.txt,看看浏览器标签页里的标题,再在首页源码里搜索「application/ld+json」。本文的三项检查不需要别的。