Voltar as noticias
Reduza em 60% os Custos do Claude Code Roteando para DeepSeek e Groq
MCP ProtocolMediaEN

Reduza em 60% os Custos do Claude Code Roteando para DeepSeek e Groq

Dev.to - MCP·26 de agosto de 2026

Corte as contas do Claude Code em 60% redirecionando para DeepSeek e Groq

Resumo

Claude Code é ótimo. Usar Claude Code no Sonnet 5 para cada solicitação é caro. Se você direcionar o Claude Code para um gateway que fala OpenAI, Anthropic e MCP, pode manter o mesmo fluxo de trabalho e redirecionar o trabalho barato (refatorações, pequenas edições, buscas em logs, testes unitários) para DeepSeek V4 Flash ou Groq gpt-oss, enquanto mantém o trabalho difícil no Sonnet ou Opus. Em uma carga de trabalho real de desenvolvedor, a conta combinada cai entre 60% e 92%.

A Configuração

Claude Code é a razão padrão pela qual muitos desenvolvedores recebem uma conta da Anthropic em primeiro lugar. Sessões longas, grande contexto, uso de ferramentas, MCP, sub-agentes. Cada uma dessas coisas é um ótimo recurso. Cada uma dessas coisas também é um multiplicador de tokens.

Aqui está como é um usuário pesado do Sonnet 5 hoje, em números arredondados:

Modelo Entrada $/M Saída $/M Combinado 5:1 por 6M tokens
claude-opus-5 5.00 25.00 $50.00
claude-sonnet-5 2.00 10.00 $20.00
claude-haiku-4-5 1.00 5.00 $10.00

Combinado 5:1 (5 de entrada para 1 de saída) é uma aproximação razoável para o tráfego de codificação interativa. Se você enviar 6M tokens por dia através do Sonnet 5, isso dá cerca de $600 por mês. O Opus é 2,5 vezes isso.

Agora a mesma matemática para os modelos que você nunca pensa quando está dentro do Claude Code:

Modelo Entrada $/M Saída $/M Combinado 5:1 por 6M tokens
deepseek-v4-flash (fora do pico) 0.22 0.66 $1.76
deepseek-v4-pro (fora do pico) 0.66 1.98 $5.28
groq/openai/gpt-oss-120b 0.15 0.60 $1.35
groq/openai/gpt-oss-20b 0.075 0.30 $0.675
openai/gpt-5-nano 0.05 0.40 $0.65
openai/gpt-5-mini 0.25 2.00 $3.25

DeepSeek V4 Flash é aproximadamente 11 vezes mais barato que o Sonnet 5 em custo combinado. GPT-5 Nano é aproximadamente 30 vezes mais barato. Groq gpt-oss-120b fica entre os dois, sendo 15 vezes mais barato, e roda em LPUs, então é rápido o suficiente para que você mal sinta a viagem de ida e volta.

A questão não é se esses números são reais. Eles são. A questão é como você realmente usa esses modelos mais baratos de dentro da sua sessão do Claude Code sem quebrar seu fluxo de trabalho.

É sobre isso que o restante deste post se trata.

Por que isso era difícil antes

Claude Code se comunica com a Anthropic. Isso é intencional. A Anthropic fornece o CLI, a Anthropic possui o modelo, a Anthropic possui a fatura.

Se você quiser redirecionar parte desse tráfego para um modelo diferente, historicamente você teve algumas opções ruins:

  1. Trocar ferramentas manualmente. Sair do Claude Code, executar algo no Cursor com um provedor diferente, colar a resposta de volta. Lento, quebra seu contexto, mata seu fluxo.
  2. Executar um proxy local. Configurar LiteLLM ou um contêiner Docker, substituir ANTHROPIC_BASE_URL, esperar que o formato da resposta corresponda. Funciona, mas agora você está mantendo a infraestrutura.
  3. Viver com a conta. O que a maioria das pessoas faz.

A razão pela qual nenhuma dessas opções é boa é que o Claude Code foi construído em torno de um formato de comunicação (Mensagens da Anthropic) e uma superfície MCP. Se você quiser redirecionar para OpenAI, DeepSeek, Groq, xAI ou um dos laboratórios chineses, você precisa de algo no meio que fale ambos os formatos de comunicação e encaminhe o MCP corretamente.

Essa coisa é um gateway.

A Configuração

Aqui está toda a pilha uma vez que você tem um gateway no meio:

Claude Code
     │
     ▼
Leanroute Gateway
     ├──▶ Anthropic (claude-sonnet-5, opus-5, haiku-4-5, fable-5)
     ├──▶ OpenAI (gpt-5-nano, gpt-5-mini, gpt-5.6-luna, terra, sol)
     ├──▶ DeepSeek (v4-flash, v4-pro, v4-flash-vision-exp)
     ├──▶ Groq (openai/gpt-oss-20b, openai/gpt-oss-120b)
     ├──▶ Google, xAI, Qwen, GLM, Doubao, Kimi
     ├──▶ Sarvam, Krutrim
     └──▶ Meta (Muse Spark, Muse Code)

Mesmo binário do Claude Code. Mesmas ferramentas, mesmos servidores MCP, mesmo comportamento de cache de prompts. O que muda é o endpoint para o qual seu claude local está apontado e qual string de modelo você digita.

A configuração é feita em três etapas.

Passo 1. Obtenha uma chave Leanroute.

Inscreva-se em leanroute.dev, adicione crédito, crie uma chave de execução no painel. A chave se parece com gw_live_... e funciona em qualquer lugar onde o formato de comunicação da OpenAI ou da Anthropic funcione.

Passo 2. Aponte o Claude Code para Leanroute.

Defina duas variáveis de ambiente no seu perfil de shell:

export ANTHROPIC_BASE_URL="https://api.leanroute.dev/anthropic"
export ANTHROPIC_API_KEY="gw_live_your_key_here"

O subcaminho anthropic informa ao Leanroute para falar o formato de mensagens da Anthropic. Tudo que o Claude Code enviar, incluindo chamadas de ferramentas, imagens, blocos de servidores MCP mcp_servers e prompts de sistema, será encaminhado sem modificações.

Passo 3. Instale o servidor MCP do Leanroute.

npm install -g @leanroute/mcp-server

Então, na sua configuração do MCP do Claude Code (~/.config/claude/mcp.json ou equivalente para seu SO), adicione:

{
  "mcpServers": {
    "leanroute": {
      "command": "npx",
      "args": ["-y", "@leanroute/mcp-server"],
      "env": {
        "LEANROUTE_ADMIN_KEY": "gw_admin_your_admin_key_here"
      }
    }
  }
}

O servidor MCP expõe ferramentas como list_models, get_pricing, cheapest_for, get_usage e route_call. Agora o Claude Code pode se perguntar, no meio da conversa, questões como "qual é o modelo flagship mais barato que posso usar para esta refatoração" e redirecionar conforme necessário.

Essa é toda a instalação.

Contexto Triplo Up

Empresas brasileiras podem reduzir significativamente os custos de uso de IA ao implementar gateways que conectam diferentes modelos de IA. Essa estratégia permite otimizar o uso de recursos e melhorar a eficiência operacional.

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.