Ir para o conteúdo
Waseit
← Todos os artigos
AEOGEO

1 227 pedidos ao llms.txt, zero robôs de IA: não há ficheiro nenhum para colocar

Os robôs de IA levam milhares de páginas por cada visitante que devolvem, e o ficheiro que deveria falar-lhes não é lido por nenhum deles. O que dizem as medições publicadas.

0 em 1 227

pedidos ao llms.txt vindos de um robô dos grandes laboratórios, num estudo de registos de servidor

3 de setembro de 20269 min de leitura
Neste artigo
  1. A troca está desequilibrada, e conta-se
  2. O ficheiro que ninguém lê
  3. O que diz a Google, oficialmente
  4. Porque não há ficheiro nenhum para colocar
  5. O que isto muda

Resposta curta: não se configura a própria visibilidade nas respostas de IA. Duas medições dizem-no em conjunto. De um lado, os robôs dos grandes modelos levam centenas a milhares de páginas por cada visitante que devolvem. Do outro, o ficheiro llms.txt que o setor começou a colocar na raiz dos sites não é pedido por nenhum robô verificado dos grandes laboratórios, e a Google declara ignorá-lo. Não há porta de serviço: o que conta joga-se no corpus.

3 389 : 1

páginas levadas pelo robô da Mistral por visitante devolvido (Cloudflare Radar, julho de 2026)

nenhuma

correlação medida entre publicar llms.txt e ser citado, em cerca de 300 000 domínios

Não há ficheiro para colocar na raiz para existir dentro de uma resposta de IA. A visibilidade ganha-se no corpus, não se declara.

A troca está desequilibrada, e conta-se

A Cloudflare publica um indicador simples e brutal: a razão entre o número de páginas que uma plataforma de IA vai ler num site e o número de visitantes que lhe devolve. A definição é mecânica. Contam-se os pedidos HTML vindos dos agentes de uma plataforma e dividem-se pelos pedidos HTML cujo cabeçalho de origem traz o nome dessa plataforma.

Páginas lidas por visitante devolvido, registo no Cloudflare Radar, janela de 28 dias fechada a 21 de julho de 2026. Uma razão lê-se como um instantâneo: move-se depressa.
PlataformaPáginas levadas por visitante devolvido
Mistral3 389 : 1
Anthropic2 237 : 1
OpenAI (GPTBot)217 : 1
DuckDuckGo2,5 : 1

A ordem de grandeza conta mais do que a decimal, e mexeu muito em 2026: a razão da Anthropic contava-se em dezenas de milhares no primeiro trimestre antes de cair para alguns milhares no verão. A direção é a certa, o desequilíbrio permanece inteiro. Para um site, significa que a leitura pelas máquinas já é a norma, enquanto a visita humana que a pagava se torna a exceção.

Uma precisão que a própria Cloudflare dá e que a reprodução esquece muitas vezes: o tráfego devolvido pela aplicação nativa do Claude não leva cabeçalho de origem. Esses reencaminhamentos são portanto invisíveis no denominador, e a Cloudflare escreve que as suas razões podem sobrestimar o desequilíbrio, sem conseguir dizer quanto. O sentido da constatação mantém-se; a sua precisão, não.

O ficheiro que ninguém lê

Perante este desequilíbrio, o setor propôs uma resposta simples: llms.txt, um ficheiro colocado na raiz do site para dizer aos modelos o que ler e como. A ideia é sedutora. Tem um defeito: os robôs não o pedem.

Um estudo de registos de servidor conduzido de setembro de 2025 a abril de 2026 em cerca de 900 domínios registou 1 227 pedidos a esses ficheiros, e nem um único vindo de um robô verificado dos grandes laboratórios - nem GPTBot, nem ClaudeBot, nem PerplexityBot, nem Google-Extended. Quem pedia era um agregador comercial de dados em 794 pedidos, ou seja 64,7 %, e navegadores humanos em 392, ou seja 31,9 %. Por outras palavras: quem lê o ficheiro são os que vendem ferramentas à volta dele, e os curiosos.

A taxa de adoção, por seu lado, depende inteiramente de quem se observa, e é por isso que se lê tudo e o seu contrário.

Taxa de adoção do llms.txt consoante a amostra. O mesmo objeto medido em quatro populações dá quatro respostas: citar apenas um destes números induz em erro.
Amostra medidaAdoção
Painel de 218 anfitriões orientados a programadores (agosto de 2026)51,8 %
Top 1 000 Tranco, raízes acessíveis (junho de 2026)15,8 %
Cerca de 300 000 domínios (novembro de 2025)10,13 %
Top 1 000 Tranco, conjunto (junho de 2026)8,7 %

E na questão que decide tudo, o estudo de correlação conduzido em cerca de 300 000 domínios não encontra nenhuma associação mensurável entre publicar este ficheiro e ser citado pelos modelos. Retirar a variável até melhorava a exatidão do modelo estatístico, o que é a forma educada de dizer que trazia ruído.

O que diz a Google, oficialmente

A posição não é ambígua. A documentação da Google, atualizada em junho de 2026, indica que o ficheiro não tem nenhum efeito, positivo ou negativo, na classificação na pesquisa nem nos AI Overviews, e que a pesquisa simplesmente o ignora. A equipa do Chrome, por seu lado, acrescentou em maio de 2026 uma verificação de llms.txt ao Lighthouse, mas arrumada nas auditorias de navegação agêntica e não nas auditorias de SEO, e só assinala um erro de servidor, nunca um ficheiro em falta.

Essa arrumação diz muito: o ficheiro é tratado como um objeto destinado a agentes que percorrem a web por conta de um utilizador, não como um sinal de posicionamento. Colocá-lo custa quase nada e não faz mal. Simplesmente não se deve esperar dele visibilidade.

Porque não há ficheiro nenhum para colocar

As duas medições respondem-se. Os modelos leem massivamente a web aberta, incluindo as suas páginas, e fazem-no sem passar por uma porta que tenha aberto. O que retêm sobre si não vem, portanto, de uma declaração feita na raiz do seu domínio, mas do que se diz sobre si através de um corpus que não controla.

É o prolongamento exato do que mostra a comparação entre motores: não leem as mesmas fontes e, ainda assim, concordam bem mais sobre os nomes que recomendam. Um ficheiro de configuração nada pode contra isso, num sentido ou no outro. O que pesa é a coerência do que está escrito sobre si, em toda a parte, e a possibilidade de uma máquina o atribuir.

  • Uma razão de recolha é um instantâneo, não uma constante.

    Os números da Cloudflare mexem de mês para mês e caíram uma ordem de grandeza ao longo de 2026. Comparar um registo de julho com um de março não faz sentido, e não os medimos nós próprios.

  • A Cloudflare avisa que as suas próprias razões podem sobrestimar o desequilíbrio.

    Os reencaminhamentos da aplicação nativa do Claude não enviam cabeçalho de origem e faltam, por isso, no denominador. A empresa di-lo e precisa que desconhece a dimensão do enviesamento: reproduzimos o aviso junto com o número.

  • O estudo dos registos de servidor é pequeno.

    1 227 pedidos em cerca de 900 domínios: chega para constatar que nenhum robô dos grandes laboratórios ali aparece, não chega para afirmar que nenhum aparecerá alguma vez, nem para falar em nome de toda a web.

  • As taxas de adoção não são comparáveis entre si.

    De 8,7 % a 51,8 % consoante a amostra, para o mesmo objeto: a diferença está na população observada, não numa evolução. Um artigo que cite apenas uma delas, sem dizer qual, não lhe ensina nada.

O que isto muda

Não conte com um ficheiro.

Colocar llms.txt é barato e inofensivo, mas nenhuma medição publicada o liga a uma citação. Não é uma alavanca de visibilidade, é quando muito uma cortesia para com agentes que ainda não existem.

Leia os seus próprios registos.

Numa consulta fica a saber que robôs vêm ao seu site, com que frequência e o que pedem. É o único dado deste dossiê que pode produzir sozinho, e vale mais do que uma média mundial.

Decida o que deixa levar.

A razão entre páginas lidas e visitantes devolvidos é uma negociação, não uma fatalidade. Autorizar, abrandar ou bloquear um agente é uma decisão comercial que lhe pertence, tomada robô a robô.

Meça a citação, não a conformidade.

Ter assinalado as caixas técnicas nada diz sobre a sua presença numa resposta. A pergunta útil continua a ser: o seu nome sai, em que motor, e ao lado de quem.

Perguntas frequentes

Devo publicar mesmo assim um ficheiro llms.txt?
Pode, não faz mal e o custo é próximo de zero. Mas nenhuma medição publicada mostra efeito na citação: um estudo sobre cerca de 300 000 domínios não encontra associação, e a Google indica desde junho de 2026 que o ficheiro não tem efeito na classificação nem nos AI Overviews. Publique-o se quiser documentar o seu site para futuros agentes, não para ganhar visibilidade.
Devo bloquear os robôs de IA?
É uma decisão comercial, não técnica, e toma-se robô a robô. As razões publicadas mostram diferenças consideráveis entre plataformas, de alguns milhares de páginas levadas por visitante devolvido a algo próximo do equilíbrio. Bloquear protege as suas páginas mas também o retira das respostas onde os seus concorrentes vão permanecer. Olhe primeiro para os seus registos, depois decida fonte a fonte.
Se o ficheiro não serve, o que é que funciona?
O que as medições apontam é a coerência do que se diz sobre si onde os motores realmente leem, e a possibilidade de uma máquina atribuir uma afirmação a uma fonte. As alavancas testadas na investigação sobre otimização para motores generativos são editoriais: citar fontes, reportar declarações, apresentar números, escrever com clareza. Nada que se coloque na raiz de um domínio.