Aqui está uma frase que eu não pensei que escreveria: Estou do lado de um scraper de busca que revende dados para empresas de IA. Não porque a SerpApi é o bom da fita. Não há bom da fita aqui. Mas um juiz federal na Califórnia decidiu contra o Google em sua luta com eles, e o princípio por trás da decisão é o correto, mesmo que tenha aparecido vestindo o traje mais feio disponível. Se está na web aberta, uma máquina tem permissão para lê-lo. E isso deve incluir a máquina lendo o Google. Você não pode passar mais de duas décadas construindo a biblioteca mais rica da Terra ao rastrear as páginas de todo mundo e depois agir horrorizado quando alguém aponta um crawler para a sua.
Então, ou realmente queremos dizer essa coisa de web aberta, ou paramos de dizer isso.
O Que O Tribunal Realmente Disse
No dia 20 de julho, a Juíza Chefe Yvonne Gonzalez Rogers rejeitou as alegações de DMCA do Google contra a SerpApi, uma empresa cujo negócio inteiro é fazer scraping dos resultados de busca do Google e revendê-los através de uma API, cada vez mais para empresas de IA. A teoria do Google era que a SerpApi quebrou a lei ao contornar o SearchGuard, seu sistema anti-bot. Se você não ouviu falar do SearchGuard, junte-se ao clube: É a maquinaria interna que o Google usa para detectar tráfego automatizado e impedir que ele faça scraping dos resultados de busca, o segurança na porta dos resultados do Google. A alegação do Google era que vencer esse segurança conta como uma contorno ilegal sob o DMCA, a mesma lei que torna ilegal quebrar a proteção contra cópias de um DVD. A juíza não ficou convencida. Seu raciocínio: O SearchGuard protege a receita publicitária do Google, não uma obra protegida por direitos autorais, e o anti-circunvenção do DMCA diz respeito a direitos autorais. Um muro em torno do seu modelo de negócios não é uma fechadura em um arquivo protegido por direitos autorais. Ela rejeitou a alegação com prejuízo onde não havia conteúdo protegido por direitos autorais envolvido e deu ao Google 21 dias para voltar com uma versão restrita sobre imagens do Knowledge Panel. Boa sorte com isso.
Deixe-me ser honesto sobre o elenco. A SerpApi faz scraping em escala industrial e revende os resultados, muito do que alimenta as exatas empresas de IA que todos estão nervosos, então não, não é um autor simpático. O Google é uma empresa trilionária que se construiu rastreando a web aberta e agora quer que a lei de direitos autorais impeça outros de rastreá-la, o que também não é uma posição simpática. Estes são dois pesos pesados lutando sobre quem pode empacotar a web, e o resto de nós está assistindo da arquibancada. É o meme do pior tipo de pessoa que você conhece faz um grande ponto, em forma de processo legal.
As Pessoas Não Estão Nesta Luta
Quando a história é contada como SerpApi contra Google, algo fica faltando: A web aberta deveria ser feita pelo povo e para o povo. Olhe para esta luta e tente encontrar uma pessoa nela. Os usuários cujas buscas, páginas e perguntas tornam a web valiosa para scraping em primeiro lugar não são parte de nada. Duas empresas brigam pelos despojos, um juiz traça uma linha, e todos os outros leem sobre o resultado depois.
Mas a linha que ela traçou é a honesta, e eu aceitarei uma linha honesta mesmo em uma luta feia. Se está na web, deve ser acessível por qualquer um que queira lê-lo. Esse é um princípio lindo quando é o muro de outra pessoa caindo. Dói quando você se lembra de quem possui o maior crawler do planeta. A existência inteira do Google é a web aberta transformada em um produto. Executar esse manual por mais de duas décadas e então declarar seus próprios resultados o único canto da internet à prova de rastreamento não é uma posição legal, é coragem. O Google também é um alvo. Esse é o acordo que ele assinou no dia em que apontou seu primeiro crawler para o site de alguém.
E Este É O Todo Web Agente, Não Uma Nota de Rodapé de Scraping
“Em que termos um visitante automatizado é permitido acessar conteúdo público da web?” é a pergunta fundamental da web agente, não uma disputa de scraping de nicho, e não termina com a SerpApi. Um scraper revendendo resultados, um motor de respostas lendo suas páginas para citá-lo, um agente de compras aparecendo para comprar em nome de alguém, um assistente puxando suas especificações para compará-lo com um concorrente. Aos olhos da lei, essas são uma coisa: um visitante automatizado em conteúdo público. A SerpApi é o feio caso de teste inicial. Qualquer limite que os tribunais desenharem ao seu redor é o limite para todos eles.
E este não é um problema para um dia qualquer. Uma parte real e crescente do que atinge seu site já não é humano. Os termos para quanto controle você tem sobre esses visitantes estão sendo escritos agora, um processo judicial de cada vez, em lutas nas quais você não tem assento. É exatamente por isso que a única decisão que é sua importa tanto.
Onde Você Realmente Está
Você também está nisso, e você é duas coisas ao mesmo tempo, e elas não se dão bem.
Você é uma das pessoas. Seu conteúdo é raspado, revendido e despejado em modelos, e ninguém lhe enviou um formulário para assinar. A luta é sobre sua web também, e seu assento à mesa é do mesmo tamanho que o dos usuários: nenhum.
Você também é um pequeno Google. Você gostaria de ter voz sobre quem pega seu conteúdo e em quais termos, e talvez você gostaria de ser pago por isso. Esta decisão reduz as ferramentas para isso, porque o precedente não tem nada a ver com o Google especificamente. Um muro anti-bot que protege sua receita em vez de uma obra protegida por direitos autorais é o que a maioria dos sites está executando, e o tribunal disse que esse tipo de muro não lhe dá proteção sob o DMCA.
Esta é a mesma fronteira que o caso Amazon v. Perplexity está testando do lado oposto. Esse caso se baseia na CFAA e pergunta se um agente de IA conta como um visitante autorizado quando atua em seu site. Este se baseia no DMCA e pergunta se seu muro anti-bot conta como proteção de direitos autorais. Estatutos diferentes, mesma pergunta por baixo, e as ferramentas para manter as máquinas fora continuam aparecendo mais curtas do que as pessoas que contam com isso esperavam.
Pare de Esperar Que Alguém Decida Por Você
A lição não é uma caixa de seleção para você marcar. É onde sua cabeça deve estar.
Você não pode se fartar da web aberta para descoberta, cada pedaço de tráfego que você já foi encontrado, citado ou classificado, e então apertar suas pérolas quando essa mesma abertura permite que uma máquina que você não gosta o leia.

