O Common Crawl analisou mais de 500.000 arquivos llms.txt e descobriu que 68% se originaram de um plugin ou modelo, enquanto 22% não tinham links.
A análise, compartilhada pelo engenheiro de pesquisa sênior Malte Ostendorff, mostrou que 6% dos arquivos incluíam diretrizes sobre o uso do site por IA, como limites de taxa e avisos de direitos autorais, que o padrão llms.txt não cobre. Além disso, alguns arquivos nomeavam crawlers específicos e se eles tinham permissão para acessar, algo que o llms.txt não pode regular. Dos 32 arquivos que pareciam negar o acesso ao próprio crawler do Common Crawl, a equipe conseguiu avaliar 31 sites, e nenhum bloqueou o crawler diretamente no robots.txt.
Em junho, eu cobri dados do Ahrefs mostrando que 97% dos arquivos llms.txt em seu conjunto de dados não receberam solicitações. Essa análise focou em se alguém acessou os arquivos. O artigo do Common Crawl examina o conteúdo desses arquivos.
A Maioria dos Arquivos Vem de Modelos
Wix representa 41% dos arquivos analisados. Alguns geradores incluem uma linha nomeando a ferramenta, e a análise agrupou arquivos não assinados por um modelo compartilhado.
Quase metade (49%) possui a estrutura completa que a análise testou: um título H1, um bloco de citação resumido e seções de listas de links. 32% adicionam uma breve nota descrevendo cada link, e 22,56% não têm links. A especificação exige apenas o H1 e trata as notas de link como opcionais.
Ao longo de 73.000 arquivos, o All in One SEO nunca escreve um resumo, mas tem uma mediana de 138 links. O artigo diz que trata o llms.txt como um sitemap. Os arquivos de domínio estacionado da GoDaddy passam com sucesso por todas as verificações estruturais mesmo sem links, servindo como uma proposta de venda.
Alguns Sites Estão Usando llms.txt Como robots.txt
O formato llms.txt é uma proposta para fornecer aos sistemas de IA uma lista curada das páginas de um site. O relatório explica que o arquivo "não concede nada e não bloqueia nada, e nenhum crawler é obrigado a lê-lo." Crawlers se referem ao robots.txt para aprender as regras de acesso.
Alguns sites podem estar confundindo llms.txt com robots.txt. Além dos arquivos llms.txt analisados, o Common Crawl encontrou 136.578 arquivos robots.txt no caminho llms.txt, o que representa cerca de 10% das 1.287.207 respostas que retornaram HTTP 200.
Dos arquivos analisados, 1.570 citaram um crawler específico, enquanto 32 pareciam negar o acesso ao CCBot. Arquivos robots.txt foram recuperados para todos os 32 sites, e nenhum dos 31 sites que puderam ser avaliados bloqueou o CCBot diretamente. Cinco sites permitiram explicitamente, 11 limitaram o acesso a certos caminhos, mas permitiram outros, e 15 não tinham restrições. Um site retornou um erro HTTP 429 e não pôde ser testado.
O artigo aponta um site onde o arquivo llms.txt afirma que o CCBot está bloqueado "a partir de junho de 2026", mas, curiosamente, seu robots.txt realmente permite o crawler sob uma regra de curinga. O post descreve o llms.txt como uma descrição de política em vez de uma política em si, e diz que ele se desincronizou com o robots.txt que descreve.
O Common Crawl opera o CCBot, e afirma que o robots.txt é o arquivo que respeita.
A Injeção de Prompt Existe, Mas É Rara
Dez arquivos corresponderam ao teste mais rigoroso do Common Crawl para instruções direcionadas ao próprio modelo. A equipe encontrou quatro casos genuínos, incluindo um arquivo cujo resumo diz ao modelo para ignorar instruções anteriores e buscar um segundo arquivo. Os outros seis foram falsos positivos, principalmente documentação que citava tokens de controle para explicá-los.
Os autores esclarecem que a descoberta não é que o llms.txt está cheio de injeções de prompt. Em todos os casos reais identificados, indivíduos intencionalmente o inseriram para fazer um ponto. Além disso, 3.793 arquivos mostraram orientações mais brandas, como dizer "focar nessas páginas."
O Que A Análise Pode E Não Pode Mostrar
A amostra veio de sites que o CCBot havia buscado recentemente sem problemas. O crawl solicitou /llms.txt de um grande grupo aleatório desses sites, amostrando /llms-full.txt de forma mais específica, e incluiu sites já conhecidos por servir qualquer um dos arquivos de dois crawls anteriores.
Isso significa que a amostra é aleatória apenas dentro dos sites acessíveis ao crawler, não em toda a web. O post menciona que sua taxa de adoção de 11% para /llms.txt não é diretamente comparável a números do Ahrefs ou do Web Almanac porque as populações diferem.
Essa análise é baseada em um único crawl, portanto, não pode determinar se arquivos modelados, linguagem de política ou injeções de prompt estão aumentando. Ela também não pode confirmar se algum sistema de IA lê esses arquivos. As contagens para políticas e injeções são baseadas em correspondências de palavras-chave, que o post admite serem provavelmente subcontagens.
Por Que Isso Importa
Uma restrição de crawler escrita no llms.txt não faz nada por si só. O Common Crawl menciona que o CCBot respeita o robots.txt, então, para esse crawler, a regra precisa ser incluída lá. Além disso, qualquer linha do llms.txt sobre isso deve corresponder a essas regras.
Olhando Para Frente
A atualização llms.txt v2 que relatei em agosto introduziu relações de link para facilitar a localização de versões em Markdown das páginas. No entanto, não alterou o que o arquivo pode impor. Como plugins e construtores de sites agora criam cerca de dois terços dos arquivos que o Common Crawl encontra, como o formato é usado na prática depende mais do que essas ferramentas produzem do que da escrita manual.
Imagem em Destaque: Cast Of Thousands/Shutterstock


