Voltar as noticias
Chrome Acabou com 8 dos Meus 12 Scrapers Puppeteer
WebMCPAltaEN

Chrome Acabou com 8 dos Meus 12 Scrapers Puppeteer

Dev.to - WebMCP·27 de julho de 2026

Chrome Acabou de Matar 8 dos Meus 12 Scrapers Puppeteer

Google I/O 2026 lançou três atualizações do Chrome que tornaram dois terços do meu código de scraping de produção obsoleto da noite para o dia. Eu executo automação de navegador para pequenas empresas de contabilidade — recibos extraídos de portais de fornecedores, PDFs OCR'd, itens de linha enviados para software de contabilidade. Na semana passada, abri meu repositório de scrapers, fiz a contagem em relação aos novos primitivos do Chrome e cortei oito dos doze scripts. Aqui está exatamente o que morreu, o que sobreviveu e quais categorias de SaaS na sua lista de faturas estão com os dias contados.

A contagem: 12 scrapers dentro, 4 scrapers fora

Antes das atualizações, meu repositório tinha doze scripts Puppeteer em produção. Cada um era uma pequena empresa — fazendo login em um portal de fornecedor, baixando faturas ou recibos, extraindo itens de linha, enviando-os para os livros do cliente. Após a migração para os primitivos do Chrome em sites cooperativos, quatro scripts permanecem. Os outros oito estão arquivados.

Categoria do scraper Contagem antes Contagem depois Eliminado por
Portais com endpoints JSON ocultos 5 0 WebMCP
Pipelines de OCR + classificação de PDF 3 0 IA embutida (Gemini Nano)
Login/download/reconciliação em múltiplas etapas 0 0 Habilidades no Chrome (incorporadas)
Portais hostis (seletor rotativo, captchas) 4 4 Nada. Ainda Puppeteer + proxies.
Total 12 4

Zero código meu nos oito que matei. O Google enviou a substituição em uma atualização do navegador. O restante deste post percorre cada primitivo, o que realmente substitui e como executar a mesma auditoria na sua própria fatura de SaaS.

WebMCP substitui o scraper "reversa-engenharia do JSON oculto"

WebMCP permite que um site exponha ferramentas diretamente a um agente de navegador através de um protocolo padrão — um contrato de API que vive dentro da página. Em vez de seu agente analisar HTML, clicar em botões e rezar para que o DOM não mude, o site declara quais ações existem e quais dados retornam. Em sites cooperativos, isso substitui cada scraper cujo trabalho era reverter a engenharia da aba de rede e acessar endpoints JSON não documentados.

Cinco dos meus doze scrapers estavam fazendo exatamente isso. Aqui está como um deles parecia antes:

// Antigo: Puppeteer perseguindo um endpoint oculto
await page.goto('https://vendor-portal.example.com/invoices');
await page.waitForSelector('#invoice-table');

// Interceptar o XHR que a tabela dispara internamente
const invoicesJson = await page.evaluate(async () => {
  const res = await fetch('/api/v3/invoices?range=90d', {
    credentials: 'include',
    headers: { 'X-CSRF-Token': window.__csrf }
  });
  return res.json();
});

// Lidar com paginação, 429s, mudanças na forma do DOM, expiração de sessão...

Esse script quebrava em média a cada 6-8 semanas sempre que o fornecedor rotacionava seu padrão CSRF ou adicionava um cabeçalho de limite de taxa. A versão do WebMCP, em um portal cooperativo:

// Novo: pergunte ao site o que ele oferece
const tools = await chrome.webmcp.listTools(tabId);
// -> [{ name: 'list_invoices', params: { range: 'string' } }, ...]

const invoices = await chrome.webmcp.callTool(tabId, 'list_invoices', {
  range: '90d'
});

Sem análise de DOM. Sem perseguição de CSRF. Sem quebra quando o fornecedor redesenha sua interface, porque o contrato é a declaração da ferramenta, não o HTML. Todo SaaS que se precificou em "nós lidamos com mudanças de DOM para você" acaba de perder sua vantagem em sites cooperativos.

O que o WebMCP não conserta

  • Sites que se recusam a publicar ferramentas (qualquer portal adversarial — bancos, governo, fornecedores hostis).
  • Fluxos de autenticação atrás de provedores SSO que bloqueiam agentes de usuário automatizados.
  • Qualquer coisa que exija resolução de captcha.

IA embutida colapsa a camada intermediária de OCR + classificação

Gemini Nano agora roda no dispositivo dentro do Chrome. Isso significa que OCR, classificação, extração de entidades e estruturação simples acontecem localmente sem conta de API e sem salto de rede. Três dos meus scrapers existiam apenas para transportar PDFs baixados através de um pipeline de OCR na nuvem (aproximadamente $0.015 por página no meu volume) e depois executar um classificador para marcar itens de linha de fornecedores. Essa camada intermediária inteira colapsa em uma chamada do navegador.

O fluxo antigo, por recibo:

Baixar PDF (Puppeteer)
  → Fazer upload para Google Document AI ($0.015/página)
  → GPT-4o-mini para classificação de itens de linha (~$0.002/recibo)
  → JSON estruturado para Postgres
Custo: ~$0.017/recibo × 1.800/mês = $30.60/mês, além de 2-4s de latência por recibo.

O novo fluxo:

// IA embutida no Chrome, no dispositivo
const session = await window.ai.processReceipt(pdfData);
Contexto Triplo Up

As mudanças no Chrome impactam diretamente empresas que dependem de automação para coleta de dados. O WebMCP oferece uma solução mais robusta e eficiente, reduzindo custos e complexidade na integração de dados. Isso pode transformar a forma como pequenas e médias empresas gerenciam suas operações.

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.