
llms.txt: Funciona realmente? O que os logs de servidor mostram
O arquivo foi implementado em 844.000 sites (BuiltWith, em 25 de outubro de 2025). Se o GPTBot, ClaudeBot ou PerplexityBot realmente o acessam é uma questão que apenas os logs do próprio servidor podem responder. Este post fornece a metodologia.
TLDR
- O padrão existe desde setembro de 2024, proposto por Jeremy Howard (Answer.AI / fast.ai), documentado em llmstxt.org.
- A disseminação cresce, uso não comprovado: 844.000 sites segundo BuiltWith (em 25 de outubro de 2025), mas nenhum grande fornecedor de IA confirmou oficialmente que o conteúdo é utilizado para inferência.
- Posição do Google: John Mueller comparou llms.txt em abril de 2025 com a meta tag de palavras-chave histórica e escreveu que os logs do servidor mostraram que os serviços de IA nem sequer solicitam o arquivo.
- Experimento Semrush no Search Engine Land (agosto a outubro de 2025): zero visitas do GPTBot, ClaudeBot, PerplexityBot ou Google-Extended ao llms.txt em dez semanas.
- Consequência prática: implementar continua a ser sensato como uma preparação econômica, mas a evidência de eficácia é hoje inexistente. A própria verificação é feita através do log do servidor, não através de painéis de ferramentas.
O Hype e suas Limitações
llms.txt tornou-se em doze meses a recomendação padrão em quase todos os artigos de GEO e SEO de IA. Ahrefs, Semrush, Yoast, Neil Patel e dezenas de agências publicam guias de configuração. BuiltWith contava, em 25 de outubro de 2025, mais de 844.000 domínios com um llms.txt no diretório raiz. Para comparação: o robots.txt é estimado em mais de 100 milhões de sites, portanto, ainda está a duas ordens de magnitude de distância, mas o crescimento trimestral é acentuado.
A contradição: paralelamente à adoção, não há uma única declaração pública da OpenAI, Anthropic ou Google de que seus sistemas utilizam o arquivo para inferência ou treinamento. A Anthropic, embora hospede um llms.txt em docs.anthropic.com, isso é do lado do cliente (hospedagem de documentação) e não um suporte oficial para o lado do servidor (crawling e utilização).
Essa assimetria entre hype e evidência é o problema que este post aborda. O foco é metodológico: como verificar o efeito real por conta própria, sem depender das declarações dos fornecedores de ferramentas?
O que é llms.txt e o que promete
Uma breve recapitulação para iniciantes. Uma profundidade com a estrutura do arquivo, exemplos e melhores práticas está no Guia Principal sobre llms.txt.
llms.txt é um arquivo de texto no formato Markdown, localizado em example.com/llms.txt. Jeremy Howard propôs o padrão em 3 de setembro de 2024. O propósito segundo llmstxt.org: "fornecer informações para ajudar os LLMs a usar um site no momento da inferência". O arquivo contém um título, um resumo e links curados para as principais subpáginas com breves descrições.
A promessa: um sistema de IA que responde perguntas sobre a marca ou setor lê llms.txt como um sinal de contexto, entende o site mais rapidamente, prioriza os conteúdos corretos e cita a fonte corretamente. O mecanismo é plausível, mas a empiria falta.
A Lacuna de Evidência
O Google foi o primeiro grande jogador a se pronunciar explicitamente. John Mueller escreveu em abril de 2025 no Reddit, citado no Search Engine Journal:
"AFAIK nenhum dos serviços de IA disse que está usando LLMs.TXT (e você pode perceber quando olha para os logs do seu servidor que eles nem checam isso). Para mim, é comparável à meta tag de palavras-chave."
A comparação com a meta tag de palavras-chave é pertinente. Essa tag foi, no final dos anos 1990, a tentativa de fornecer aos webmasters uma interface de declaração para os motores de busca. O Google a descartou publicamente como sinal de classificação em 2009, porque era muito fácil de manipular e a verificação cruzada com o conteúdo real da página era imprescindível. O ponto de Mueller: também llms.txt é um arquivo autodeclarado. Um sistema de IA precisaria verificar as informações contra o conteúdo real da página, caso contrário, seria uma porta de entrada para manipulação. O overhead de verificação torna o arquivo redundante.
A Semrush testou a tese internamente. No Search Engine Land, uma propriedade irmã, um llms.txt foi implementado entre meados de agosto e o final de outubro de 2025. O resultado segundo o blog da Semrush: zero visitas do Google-Extended, GPTBot, PerplexityBot e ClaudeBot durante todo o período de observação. O Googlebot e o Bingbot acessaram o arquivo, mas o trataram sem status especial.
Ahrefs chegou à mesma conclusão no mesmo período. Ryan Law, Diretor de Marketing de Conteúdo, escreve que não há "evidências de que llms.txt melhore a recuperação de IA, aumente o tráfego ou melhore a precisão do modelo". Ahrefs recomenda análises de bots próprias e monitoramento real de marcas de IA.
Uma única pesquisa de Flavio Longato sobre 1.000 domínios do Adobe Experience Manager (30 dias de logs CDN, uma auditoria, sem múltiplos conjuntos) mostrou resultados semelhantes: o Googlebot-Desktop representou 94,9% de todos os acessos aos arquivos llms.txt, OAI-SearchBot 1,1%. GPTBot, ClaudeBot e PerplexityBot não apareceram. O número vem dessa única avaliação e não é uma média de vários estudos. Qualitativamente, a imagem se alinha com discussões da comunidade: um host de domínio com mais de 20.000 sites relatou no Reddit que exclusivamente crawlers de descoberta semelhantes ao BuiltWith acessaram o arquivo, nenhum bot de inferência.
Como você pode verificar: Metodologia de Log do Servidor
A única evidência confiável para seu próprio domínio vem do seu próprio log de acesso. Painéis de ferramentas, posts de blogs de terceiros e declarações de fornecedores não substituem isso, pois o comportamento dos bots varia por domínio e período. A seguinte metodologia funciona para logs Apache, Nginx e CDN no formato de log combinado.
Passo 1: Definir User-Agents Alvo
Os bots publicamente documentados dos grandes fornecedores de IA, para os quais a evidência de log é significativa:

