
Precificação e Portabilidade: O que Sobrevive Quando os Números Mudam
Preços e Portabilidade: O que Sobrevive Quando os Números Mudam
Este post encerra a série de Engenharia Agentic com dois apêndices que qualquer sistema de produção precisará: um instantâneo de preços por provedor em maio de 2026 e uma tabela de portabilidade mapeando os padrões da série através de harnesses.
Os preços de LLM caíram 30-60% ao ano desde 2023. O que custa $3/Mtok de entrada hoje provavelmente custará $1,50 ou menos em 12 meses. Os números abaixo ficarão desatualizados. O que não ficará: os quatro mecanismos de otimização (contabilidade de tokens, cache, lote, despacho) e a lógica por trás de cada um. Quem internaliza a estrutura recalibra os números por conta própria.
Instantâneo de preços: maio de 2026
Anthropic
| Modelo | Entrada (por Mtok) | Saída (por Mtok) |
|---|---|---|
| Claude Haiku 4.5 | $0.80 | $4.00 |
| Claude Sonnet 4.6 | $3.00 | $15.00 |
| Claude Opus 4.7 | $15.00 | $75.00 |
Os custos de saída são 5x maiores que os de entrada em toda a linha. Cache de prompt: escrever a 1.25x a entrada (TTL de 5 min), ler a 0.1x. API de lote: 50% de desconto, com timeout de até 24h. Janela de contexto: 200k tokens padrão, 1M em beta.
OpenAI
| Modelo | Entrada (por Mtok) | Saída (por Mtok) |
|---|---|---|
| GPT-5-mini | $0.50 | $2.00 |
| GPT-5 | $5.00 | $20.00 |
| GPT-5-pro | $20.00 | $80.00 |
Cache automático sem cache_control, aplica-se a prefixos repetidos em ~5min. O custo do hit é 50% da entrada. Sem prêmio de escrita de cache. API de lote: 50% de desconto, timeout de 24h.
Google Gemini
| Modelo | Entrada (por Mtok) | Saída (por Mtok) |
|---|---|---|
| Gemini 2.5 Flash | $0.30 | $1.20 |
| Gemini 2.5 Pro | $4.00 | $16.00 |
| Gemini 2.5 Ultra | $20.00 | $80.00 |
Cache de contexto explícito com TTL controlável de 5min a 24h. Componível com lote.
Auto-hospedado
O custo do modelo é zero; o custo real é GPU, eletricidade e manutenção. Modelos competitivos em maio de 2026: Qwen3 30B-instruct (rivaliza Haiku, roda em uma RTX 4090), Llama 4 Maverick 70B (rivaliza Sonnet em algumas dimensões, requer duas A100s ou uma H100), DeepSeek-R3 (nível de raciocínio, rivaliza Opus em matemática).
A auto-hospedagem só faz sentido quando: volume alto e estável (>500M tok/mês), equipe com expertise em operações de GPU, ou conformidade exige que os dados permaneçam dentro do seu perímetro.
Tabela de portabilidade
Os 12 capítulos desta série foram escritos a partir da perspectiva do Claude Code. Os padrões são universais. As implementações concretas variam.
| Padrão | Claude Code | LangGraph | OpenAI Agents SDK | AutoGen |
|---|---|---|---|---|
| Prompt do sistema |
.md arquivo com frontmatter |
SystemMessage em StateGraph |
Agent(instructions=...) |
AssistantAgent(system_message=...) |
| Restrição de ferramenta |
allow/deny em JSON de permissões |
tools=[Tool(...)] |
Agent(tools=[...]) |
register_function(name, callable=fn) |
| Habilidade | arquivo em ~/.claude/skills/
|
Ferramenta com descrição rica | Personalizado via descrição da ferramenta |
register_for_llm com docstring |
| Despacho de sub-agente | Agent({model, addDir, tools}) |
Subgrafo | Agent.run(other_agent) |
GroupChat ou nested_agent |
| Seleção de modelo | `model: "haiku | sonnet | opus"` | ChatAnthropic(model="...") |
| Hook PreToolUse | ~/.claude/hooks/PreToolUse.sh |
interrupt_before=["tool"] |
Middleware personalizado | register_hook("on_tool_call", fn) |
| Servidor MCP | ~/.mcp.json |
MultiServerMCPClient |
mcp_servers=[...] |
Plugin manual |
| Cron loop | PM2 cron_restart
|
LangServe + APScheduler | Script coordenador externo |
Scheduler plugin |
| Auto-memória | memory/*.md |
Memória LangGraph (postgres) | Session.state |
MemoryClient plugin |
| Audit chain | Hook PostToolUse + NDJSON | Rastros LangSmith | OTEL spans + hook personalizado |
Tracer plugin |
| Auto-piloto |
/eai habilidade + permissões |
interrupt_before=[] |
Agent.run(stream=False) |
human_input_mode="NEVER" |
| Kill switch | flag de arquivo + pm2 stop
|
Token de cancelamento | Matar processo externo | chat_manager.stop() |
O que sobrevive à migração
Arquitetura portátil, otimização específica do fornecedor.
A primeira camada, os padrões desta série, sobrevive a qualquer migração: transferência de sistema de arquivos, coordenador determinístico, escopo de negação por padrão, cadeia de auditoria NDJSON, avaliações com três famílias, limites de gastos. Esses padrões funcionam no LangGraph, AutoGen, Python personalizado com a API OpenAI, qualquer harness que exponha um sistema de arquivos ao trabalhador.
A segunda camada, otimizações específicas do fornecedor, você reaplica na nova pilha. O cache de prompt com cache_control é específico da Anthropic. A OpenAI tem um cache automático diferente. O Gemini tem TTLs controláveis diferentes. Os multiplicadores mudam. A lógica de "estável antes de volátil" é universal.
MCP como um protocolo é aberto, mas a adoção em harnesses não-Anthropic era parcial em maio de 2026. LangChain teve um adaptador beta. O OpenAI Agents SDK ganhou suporte nativo no Q4 de 2025. Até 2027, provavelmente será uma mercadoria.
A tentação ao ler a série: "pipelines baseados em sistema de arquivos só funcionam no Claude Code." Falso. Eles funcionam em qualquer harness com acesso ao sistema de arquivos. A complexidade está na orquestração, não no harness específico. O padrão é o que persiste; a ferramenta é intercambiável.
As empresas brasileiras devem se preparar para a queda nos custos de LLMs, o que pode impactar suas estratégias de marketing e operação. A compreensão dos mecanismos de otimização é crucial para manter a competitividade. A portabilidade das soluções pode facilitar a adoção de novas tecnologias.

