跳到正文
Waseit
← 全部文章
AEOGEO

指向 llms.txt 的1227次请求,AI爬虫为零:根本没有一个文件可放

AI爬虫每送回一位访客就取走数千个页面,而本该与它们对话的那个文件,没有一个爬虫在读。已发表的测量说明了什么。

1227次中的0次

在一项服务器日志研究中,来自主要实验室爬虫的 llms.txt 请求

2026年9月3日9 分钟读完
本文目录
  1. 这场交换并不对等,而且可以计数
  2. 没有人读的那个文件
  3. 谷歌的官方说法
  4. 为什么根本没有文件可放
  5. 这改变了什么

简短回答:在AI答案里的可见度,不是配置出来的。 两项测量共同说明了这一点。一方面,大模型的爬虫每送回一位访客,就要取走数百到数千个页面。另一方面,业界开始放在网站根目录的 llms.txt 文件,没有任何一个经过验证的主要实验室爬虫去请求它,而谷歌明确表示会忽略它。没有后门:胜负在语料里决出。

3389 : 1

每送回一位访客,Mistral爬虫取走的页面数(Cloudflare Radar,2026年7月)

没有

在约30万个域名上测得的、发布 llms.txt 与被引用之间的相关性

为了出现在AI的答案里,没有一个文件可以放到根目录。可见度是在语料中赢得的,不是声明出来的。

这场交换并不对等,而且可以计数

Cloudflare公布了一个简单而残酷的指标:一个AI平台到某个站点上读取的页面数,与它送回该站点的访客数之比。定义是机械的。统计来自某平台代理程序的HTML请求,再除以引荐头中带有该平台名称的HTML请求。

每送回一位访客被读取的页面数,取自 Cloudflare Radar,截至2026年7月21日的28天窗口。比值应当作快照来读:它变化很快。
平台每送回一位访客取走的页面
Mistral3389 : 1
Anthropic2237 : 1
OpenAI(GPTBot)217 : 1
DuckDuckGo2.5 : 1

数量级比小数位更重要,而这个数量级在2026年变动很大:Anthropic的比值在第一季度还以万计,到夏天已降到数千。方向是对的,失衡依旧完整。对一个站点而言,这意味着机器阅读已经是常态,而曾经为之付费的人类访问正在变成例外。

Cloudflare自己给出、转述中却常被略去的一点:由Claude原生应用带来的流量不携带引荐头。 这类引荐因此在分母中不可见,Cloudflare写明其比值可能夸大了失衡,却无法说明夸大多少。结论的方向站得住,精度站不住。

没有人读的那个文件

面对这种失衡,业界提出了一个简单的答案:llms.txt,一个放在站点根目录、用来告诉模型读什么以及怎么读的文件。这个想法很有吸引力。它有一个缺点:爬虫并不请求它。

一项自2025年9月至2026年4月、覆盖约900个域名的服务器日志研究记录到对这些文件的1227次请求,其中没有一次来自经过验证的主要实验室爬虫 —— 没有GPTBot,没有ClaudeBot,没有PerplexityBot,也没有Google-Extended。发起请求的是一家商业数据聚合商,794次,占64.7%;以及人类浏览器,392次,占31.9%。换句话说:读这个文件的,是围绕它卖工具的人,和好奇的人。

至于采用率,它完全取决于你看的是谁,所以你会读到互相矛盾的说法。

不同样本下的 llms.txt 采用率。同一个对象在四个总体上测量,得出四个答案:只引用其中一个数字会造成误导。
所测样本采用率
面向开发者的218个主机样本(2026年8月)51.8%
Tranco前1000,可达根域(2026年6月)15.8%
约30万个域名(2025年11月)10.13%
Tranco前1000,全体(2026年6月)8.7%

而在决定一切的那个问题上,覆盖约30万个域名的相关性研究没有发现发布该文件与被模型引用之间存在任何可测量的关联。去掉这个变量后,统计模型的准确度反而提高了,这是在礼貌地说:它带来的是噪声。

谷歌的官方说法

立场并不含糊。谷歌于2026年6月更新的文档指出,该文件对搜索排名和AI Overviews没有任何影响,无论正面还是负面,搜索只是忽略它。Chrome团队则在2026年5月为Lighthouse加入了 llms.txt 检查,但归类在代理浏览审计而非SEO审计之下,且只报告服务器错误,从不报告文件缺失。

这个归类很能说明问题:该文件被当作面向代替用户浏览网络的代理程序的对象,而不是排名信号。放上去几乎没有成本,也没有害处。只是不应指望它带来可见度。

为什么根本没有文件可放

两项测量彼此呼应。模型大量阅读开放网络,包括你的页面,而且它们并不经过你打开的任何一扇门。因此它们对你的记忆,并非来自你在域名根目录所作的声明,而是来自一个你无法控制的语料中关于你的说法。

这正是引擎间比较所显示内容的延伸:它们不读同样的来源,却在推荐的名字上一致得多。一个配置文件对此无能为力,正反两个方向都是如此。有分量的是关于你的文字在各处是否一致,以及机器能否为其归因。

  • 抓取比是快照,不是常数。

    Cloudflare的数字逐月变动,并在2026年内下降了一个数量级。拿7月的读数与3月的读数比较毫无意义,而且这些数字并非我们自己测量的。

  • Cloudflare自己警告其比值可能夸大失衡。

    来自Claude原生应用的引荐不发送引荐头,因而在分母中缺失。该公司明说了这一点,并指出不清楚偏差的幅度:我们把这个警告与数字一并转达。

  • 服务器日志研究规模不大。

    约900个域名上的1227次请求:足以确认没有主要实验室的爬虫出现在那里,却不足以断言永远不会出现,也不足以代表整个网络。

  • 各项采用率彼此不可比较。

    同一个对象,因样本不同而从8.7%到51.8%:差别在于所观察的总体,而不是随时间的变化。一篇只引用其中一个、又不说明是哪一个的文章,什么也没教给你。

这改变了什么

别指望一个文件。

放置 llms.txt 成本低且无害,但没有任何已发表的测量把它与被引用联系起来。它不是可见度的杠杆,至多是对尚不存在的代理程序的一种礼貌。

读你自己的日志。

一次查询就能知道哪些爬虫来你的站点、来得多频繁、请求了什么。这是本案中你唯一能自己产出的数据,胜过任何全球平均值。

决定你让它们取走什么。

被读页面数与被送回访客数之比是一场谈判,不是宿命。允许、限速还是屏蔽某个代理程序,是属于你的商业决定,需逐个爬虫来定。

衡量引用,而不是合规。

勾完技术清单,并不能说明你在答案中的存在。有用的问题依旧是:你的名字出现了吗,在哪个引擎,和谁并列。

常见问题

还是应该发布一个 llms.txt 文件吗
可以,无害且成本接近于零。但没有任何已发表的测量显示它对被引用有影响:一项覆盖约30万个域名的研究没有发现关联,谷歌自2026年6月起也表示该文件对排名和AI Overviews没有影响。如果你想为未来的代理程序记录自己的站点,那就发布;不要为了获得可见度而发布。
我该屏蔽AI爬虫吗
这是商业决定而非技术决定,而且要逐个爬虫来定。已发表的比值显示各平台之间差距很大,从每送回一位访客取走数千页面,到接近对等都有。屏蔽保护了你的页面,但也会把你从竞争对手仍在其中的答案里移除。先看你的日志,再逐个来源作决定。
如果文件没用,什么才有用
测量所指向的,是在引擎真正阅读的地方,关于你的说法是否一致,以及机器能否把一项主张归因到某个来源。生成式引擎优化研究中检验过的手段属于编辑层面:引用来源、转述发言、给出数字、把话写清楚。没有一样是放在域名根目录的。