Voltar as noticias
Precificação e Portabilidade: O que Sobrevive Quando os Números Mudam
Agentic SEOMediaEN

Precificação e Portabilidade: O que Sobrevive Quando os Números Mudam

Dev.to - Agentic·6 de setembro de 2026

Preços e Portabilidade: O que Sobrevive Quando os Números Mudam

Este post encerra a série de Engenharia Agentic com dois apêndices que qualquer sistema de produção precisará: um instantâneo de preços por provedor em maio de 2026 e uma tabela de portabilidade mapeando os padrões da série através de harnesses.

Os preços de LLM caíram 30-60% ao ano desde 2023. O que custa $3/Mtok de entrada hoje provavelmente custará $1,50 ou menos em 12 meses. Os números abaixo ficarão desatualizados. O que não ficará: os quatro mecanismos de otimização (contabilidade de tokens, cache, lote, despacho) e a lógica por trás de cada um. Quem internaliza a estrutura recalibra os números por conta própria.

Instantâneo de preços: maio de 2026

Anthropic

Modelo Entrada (por Mtok) Saída (por Mtok)
Claude Haiku 4.5 $0.80 $4.00
Claude Sonnet 4.6 $3.00 $15.00
Claude Opus 4.7 $15.00 $75.00

Os custos de saída são 5x maiores que os de entrada em toda a linha. Cache de prompt: escrever a 1.25x a entrada (TTL de 5 min), ler a 0.1x. API de lote: 50% de desconto, com timeout de até 24h. Janela de contexto: 200k tokens padrão, 1M em beta.

OpenAI

Modelo Entrada (por Mtok) Saída (por Mtok)
GPT-5-mini $0.50 $2.00
GPT-5 $5.00 $20.00
GPT-5-pro $20.00 $80.00

Cache automático sem cache_control, aplica-se a prefixos repetidos em ~5min. O custo do hit é 50% da entrada. Sem prêmio de escrita de cache. API de lote: 50% de desconto, timeout de 24h.

Google Gemini

Modelo Entrada (por Mtok) Saída (por Mtok)
Gemini 2.5 Flash $0.30 $1.20
Gemini 2.5 Pro $4.00 $16.00
Gemini 2.5 Ultra $20.00 $80.00

Cache de contexto explícito com TTL controlável de 5min a 24h. Componível com lote.

Auto-hospedado

O custo do modelo é zero; o custo real é GPU, eletricidade e manutenção. Modelos competitivos em maio de 2026: Qwen3 30B-instruct (rivaliza Haiku, roda em uma RTX 4090), Llama 4 Maverick 70B (rivaliza Sonnet em algumas dimensões, requer duas A100s ou uma H100), DeepSeek-R3 (nível de raciocínio, rivaliza Opus em matemática).

A auto-hospedagem só faz sentido quando: volume alto e estável (>500M tok/mês), equipe com expertise em operações de GPU, ou conformidade exige que os dados permaneçam dentro do seu perímetro.

Tabela de portabilidade

Os 12 capítulos desta série foram escritos a partir da perspectiva do Claude Code. Os padrões são universais. As implementações concretas variam.

Padrão Claude Code LangGraph OpenAI Agents SDK AutoGen
Prompt do sistema .md arquivo com frontmatter SystemMessage em StateGraph Agent(instructions=...) AssistantAgent(system_message=...)
Restrição de ferramenta allow/deny em JSON de permissões tools=[Tool(...)] Agent(tools=[...]) register_function(name, callable=fn)
Habilidade arquivo em ~/.claude/skills/ Ferramenta com descrição rica Personalizado via descrição da ferramenta register_for_llm com docstring
Despacho de sub-agente Agent({model, addDir, tools}) Subgrafo Agent.run(other_agent) GroupChat ou nested_agent
Seleção de modelo `model: "haiku sonnet opus"` ChatAnthropic(model="...")
Hook PreToolUse ~/.claude/hooks/PreToolUse.sh interrupt_before=["tool"] Middleware personalizado register_hook("on_tool_call", fn)
Servidor MCP ~/.mcp.json MultiServerMCPClient mcp_servers=[...] Plugin manual
Cron loop PM2 cron_restart LangServe + APScheduler Script coordenador externo Scheduler plugin
Auto-memória memory/*.md Memória LangGraph (postgres) Session.state MemoryClient plugin
Audit chain Hook PostToolUse + NDJSON Rastros LangSmith OTEL spans + hook personalizado Tracer plugin
Auto-piloto /eai habilidade + permissões interrupt_before=[] Agent.run(stream=False) human_input_mode="NEVER"
Kill switch flag de arquivo + pm2 stop Token de cancelamento Matar processo externo chat_manager.stop()

O que sobrevive à migração

Arquitetura portátil, otimização específica do fornecedor.

A primeira camada, os padrões desta série, sobrevive a qualquer migração: transferência de sistema de arquivos, coordenador determinístico, escopo de negação por padrão, cadeia de auditoria NDJSON, avaliações com três famílias, limites de gastos. Esses padrões funcionam no LangGraph, AutoGen, Python personalizado com a API OpenAI, qualquer harness que exponha um sistema de arquivos ao trabalhador.

A segunda camada, otimizações específicas do fornecedor, você reaplica na nova pilha. O cache de prompt com cache_control é específico da Anthropic. A OpenAI tem um cache automático diferente. O Gemini tem TTLs controláveis diferentes. Os multiplicadores mudam. A lógica de "estável antes de volátil" é universal.

MCP como um protocolo é aberto, mas a adoção em harnesses não-Anthropic era parcial em maio de 2026. LangChain teve um adaptador beta. O OpenAI Agents SDK ganhou suporte nativo no Q4 de 2025. Até 2027, provavelmente será uma mercadoria.

A tentação ao ler a série: "pipelines baseados em sistema de arquivos só funcionam no Claude Code." Falso. Eles funcionam em qualquer harness com acesso ao sistema de arquivos. A complexidade está na orquestração, não no harness específico. O padrão é o que persiste; a ferramenta é intercambiável.

Contexto Triplo Up

As empresas brasileiras devem se preparar para a queda nos custos de LLMs, o que pode impactar suas estratégias de marketing e operação. A compreensão dos mecanismos de otimização é crucial para manter a competitividade. A portabilidade das soluções pode facilitar a adoção de novas tecnologias.

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.