
Chrome Acabou com 8 dos Meus 12 Scrapers Puppeteer
Chrome Acabou de Matar 8 dos Meus 12 Scrapers Puppeteer
Google I/O 2026 lançou três atualizações do Chrome que tornaram dois terços do meu código de scraping de produção obsoleto da noite para o dia. Eu executo automação de navegador para pequenas empresas de contabilidade — recibos extraídos de portais de fornecedores, PDFs OCR'd, itens de linha enviados para software de contabilidade. Na semana passada, abri meu repositório de scrapers, fiz a contagem em relação aos novos primitivos do Chrome e cortei oito dos doze scripts. Aqui está exatamente o que morreu, o que sobreviveu e quais categorias de SaaS na sua lista de faturas estão com os dias contados.
A contagem: 12 scrapers dentro, 4 scrapers fora
Antes das atualizações, meu repositório tinha doze scripts Puppeteer em produção. Cada um era uma pequena empresa — fazendo login em um portal de fornecedor, baixando faturas ou recibos, extraindo itens de linha, enviando-os para os livros do cliente. Após a migração para os primitivos do Chrome em sites cooperativos, quatro scripts permanecem. Os outros oito estão arquivados.
| Categoria do scraper | Contagem antes | Contagem depois | Eliminado por |
|---|---|---|---|
| Portais com endpoints JSON ocultos | 5 | 0 | WebMCP |
| Pipelines de OCR + classificação de PDF | 3 | 0 | IA embutida (Gemini Nano) |
| Login/download/reconciliação em múltiplas etapas | 0 | 0 | Habilidades no Chrome (incorporadas) |
| Portais hostis (seletor rotativo, captchas) | 4 | 4 | Nada. Ainda Puppeteer + proxies. |
| Total | 12 | 4 |
Zero código meu nos oito que matei. O Google enviou a substituição em uma atualização do navegador. O restante deste post percorre cada primitivo, o que realmente substitui e como executar a mesma auditoria na sua própria fatura de SaaS.
WebMCP substitui o scraper "reversa-engenharia do JSON oculto"
WebMCP permite que um site exponha ferramentas diretamente a um agente de navegador através de um protocolo padrão — um contrato de API que vive dentro da página. Em vez de seu agente analisar HTML, clicar em botões e rezar para que o DOM não mude, o site declara quais ações existem e quais dados retornam. Em sites cooperativos, isso substitui cada scraper cujo trabalho era reverter a engenharia da aba de rede e acessar endpoints JSON não documentados.
Cinco dos meus doze scrapers estavam fazendo exatamente isso. Aqui está como um deles parecia antes:
// Antigo: Puppeteer perseguindo um endpoint oculto
await page.goto('https://vendor-portal.example.com/invoices');
await page.waitForSelector('#invoice-table');
// Interceptar o XHR que a tabela dispara internamente
const invoicesJson = await page.evaluate(async () => {
const res = await fetch('/api/v3/invoices?range=90d', {
credentials: 'include',
headers: { 'X-CSRF-Token': window.__csrf }
});
return res.json();
});
// Lidar com paginação, 429s, mudanças na forma do DOM, expiração de sessão...
Esse script quebrava em média a cada 6-8 semanas sempre que o fornecedor rotacionava seu padrão CSRF ou adicionava um cabeçalho de limite de taxa. A versão do WebMCP, em um portal cooperativo:
// Novo: pergunte ao site o que ele oferece
const tools = await chrome.webmcp.listTools(tabId);
// -> [{ name: 'list_invoices', params: { range: 'string' } }, ...]
const invoices = await chrome.webmcp.callTool(tabId, 'list_invoices', {
range: '90d'
});
Sem análise de DOM. Sem perseguição de CSRF. Sem quebra quando o fornecedor redesenha sua interface, porque o contrato é a declaração da ferramenta, não o HTML. Todo SaaS que se precificou em "nós lidamos com mudanças de DOM para você" acaba de perder sua vantagem em sites cooperativos.
O que o WebMCP não conserta
- Sites que se recusam a publicar ferramentas (qualquer portal adversarial — bancos, governo, fornecedores hostis).
- Fluxos de autenticação atrás de provedores SSO que bloqueiam agentes de usuário automatizados.
- Qualquer coisa que exija resolução de captcha.
IA embutida colapsa a camada intermediária de OCR + classificação
Gemini Nano agora roda no dispositivo dentro do Chrome. Isso significa que OCR, classificação, extração de entidades e estruturação simples acontecem localmente sem conta de API e sem salto de rede. Três dos meus scrapers existiam apenas para transportar PDFs baixados através de um pipeline de OCR na nuvem (aproximadamente $0.015 por página no meu volume) e depois executar um classificador para marcar itens de linha de fornecedores. Essa camada intermediária inteira colapsa em uma chamada do navegador.
O fluxo antigo, por recibo:
Baixar PDF (Puppeteer)
→ Fazer upload para Google Document AI ($0.015/página)
→ GPT-4o-mini para classificação de itens de linha (~$0.002/recibo)
→ JSON estruturado para Postgres
Custo: ~$0.017/recibo × 1.800/mês = $30.60/mês, além de 2-4s de latência por recibo.
O novo fluxo:
// IA embutida no Chrome, no dispositivo
const session = await window.ai.processReceipt(pdfData);
As mudanças no Chrome impactam diretamente empresas que dependem de automação para coleta de dados. O WebMCP oferece uma solução mais robusta e eficiente, reduzindo custos e complexidade na integração de dados. Isso pode transformar a forma como pequenas e médias empresas gerenciam suas operações.

