
Reduza em 60% os Custos do Claude Code Roteando para DeepSeek e Groq
Corte as contas do Claude Code em 60% redirecionando para DeepSeek e Groq
Resumo
Claude Code é ótimo. Usar Claude Code no Sonnet 5 para cada solicitação é caro. Se você direcionar o Claude Code para um gateway que fala OpenAI, Anthropic e MCP, pode manter o mesmo fluxo de trabalho e redirecionar o trabalho barato (refatorações, pequenas edições, buscas em logs, testes unitários) para DeepSeek V4 Flash ou Groq gpt-oss, enquanto mantém o trabalho difícil no Sonnet ou Opus. Em uma carga de trabalho real de desenvolvedor, a conta combinada cai entre 60% e 92%.
A Configuração
Claude Code é a razão padrão pela qual muitos desenvolvedores recebem uma conta da Anthropic em primeiro lugar. Sessões longas, grande contexto, uso de ferramentas, MCP, sub-agentes. Cada uma dessas coisas é um ótimo recurso. Cada uma dessas coisas também é um multiplicador de tokens.
Aqui está como é um usuário pesado do Sonnet 5 hoje, em números arredondados:
| Modelo | Entrada $/M | Saída $/M | Combinado 5:1 por 6M tokens |
|---|---|---|---|
| claude-opus-5 | 5.00 | 25.00 | $50.00 |
| claude-sonnet-5 | 2.00 | 10.00 | $20.00 |
| claude-haiku-4-5 | 1.00 | 5.00 | $10.00 |
Combinado 5:1 (5 de entrada para 1 de saída) é uma aproximação razoável para o tráfego de codificação interativa. Se você enviar 6M tokens por dia através do Sonnet 5, isso dá cerca de $600 por mês. O Opus é 2,5 vezes isso.
Agora a mesma matemática para os modelos que você nunca pensa quando está dentro do Claude Code:
| Modelo | Entrada $/M | Saída $/M | Combinado 5:1 por 6M tokens |
|---|---|---|---|
| deepseek-v4-flash (fora do pico) | 0.22 | 0.66 | $1.76 |
| deepseek-v4-pro (fora do pico) | 0.66 | 1.98 | $5.28 |
| groq/openai/gpt-oss-120b | 0.15 | 0.60 | $1.35 |
| groq/openai/gpt-oss-20b | 0.075 | 0.30 | $0.675 |
| openai/gpt-5-nano | 0.05 | 0.40 | $0.65 |
| openai/gpt-5-mini | 0.25 | 2.00 | $3.25 |
DeepSeek V4 Flash é aproximadamente 11 vezes mais barato que o Sonnet 5 em custo combinado. GPT-5 Nano é aproximadamente 30 vezes mais barato. Groq gpt-oss-120b fica entre os dois, sendo 15 vezes mais barato, e roda em LPUs, então é rápido o suficiente para que você mal sinta a viagem de ida e volta.
A questão não é se esses números são reais. Eles são. A questão é como você realmente usa esses modelos mais baratos de dentro da sua sessão do Claude Code sem quebrar seu fluxo de trabalho.
É sobre isso que o restante deste post se trata.
Por que isso era difícil antes
Claude Code se comunica com a Anthropic. Isso é intencional. A Anthropic fornece o CLI, a Anthropic possui o modelo, a Anthropic possui a fatura.
Se você quiser redirecionar parte desse tráfego para um modelo diferente, historicamente você teve algumas opções ruins:
- Trocar ferramentas manualmente. Sair do Claude Code, executar algo no Cursor com um provedor diferente, colar a resposta de volta. Lento, quebra seu contexto, mata seu fluxo.
- Executar um proxy local. Configurar LiteLLM ou um contêiner Docker, substituir
ANTHROPIC_BASE_URL, esperar que o formato da resposta corresponda. Funciona, mas agora você está mantendo a infraestrutura. - Viver com a conta. O que a maioria das pessoas faz.
A razão pela qual nenhuma dessas opções é boa é que o Claude Code foi construído em torno de um formato de comunicação (Mensagens da Anthropic) e uma superfície MCP. Se você quiser redirecionar para OpenAI, DeepSeek, Groq, xAI ou um dos laboratórios chineses, você precisa de algo no meio que fale ambos os formatos de comunicação e encaminhe o MCP corretamente.
Essa coisa é um gateway.
A Configuração
Aqui está toda a pilha uma vez que você tem um gateway no meio:
Claude Code
│
▼
Leanroute Gateway
├──▶ Anthropic (claude-sonnet-5, opus-5, haiku-4-5, fable-5)
├──▶ OpenAI (gpt-5-nano, gpt-5-mini, gpt-5.6-luna, terra, sol)
├──▶ DeepSeek (v4-flash, v4-pro, v4-flash-vision-exp)
├──▶ Groq (openai/gpt-oss-20b, openai/gpt-oss-120b)
├──▶ Google, xAI, Qwen, GLM, Doubao, Kimi
├──▶ Sarvam, Krutrim
└──▶ Meta (Muse Spark, Muse Code)
Mesmo binário do Claude Code. Mesmas ferramentas, mesmos servidores MCP, mesmo comportamento de cache de prompts. O que muda é o endpoint para o qual seu claude local está apontado e qual string de modelo você digita.
A configuração é feita em três etapas.
Passo 1. Obtenha uma chave Leanroute.
Inscreva-se em leanroute.dev, adicione crédito, crie uma chave de execução no painel. A chave se parece com gw_live_... e funciona em qualquer lugar onde o formato de comunicação da OpenAI ou da Anthropic funcione.
Passo 2. Aponte o Claude Code para Leanroute.
Defina duas variáveis de ambiente no seu perfil de shell:
export ANTHROPIC_BASE_URL="https://api.leanroute.dev/anthropic"
export ANTHROPIC_API_KEY="gw_live_your_key_here"
O subcaminho anthropic informa ao Leanroute para falar o formato de mensagens da Anthropic. Tudo que o Claude Code enviar, incluindo chamadas de ferramentas, imagens, blocos de servidores MCP mcp_servers e prompts de sistema, será encaminhado sem modificações.
Passo 3. Instale o servidor MCP do Leanroute.
npm install -g @leanroute/mcp-server
Então, na sua configuração do MCP do Claude Code (~/.config/claude/mcp.json ou equivalente para seu SO), adicione:
{
"mcpServers": {
"leanroute": {
"command": "npx",
"args": ["-y", "@leanroute/mcp-server"],
"env": {
"LEANROUTE_ADMIN_KEY": "gw_admin_your_admin_key_here"
}
}
}
}
O servidor MCP expõe ferramentas como list_models, get_pricing, cheapest_for, get_usage e route_call. Agora o Claude Code pode se perguntar, no meio da conversa, questões como "qual é o modelo flagship mais barato que posso usar para esta refatoração" e redirecionar conforme necessário.
Essa é toda a instalação.
Empresas brasileiras podem reduzir significativamente os custos de uso de IA ao implementar gateways que conectam diferentes modelos de IA. Essa estratégia permite otimizar o uso de recursos e melhorar a eficiência operacional.
