Voltar as noticias
Como Reduzi o Uso de Tokens MCP em 91% (e Aprendi uma Lição Humilhante Sobre Tokenizadores)
MCP ProtocolAltaEN

Como Reduzi o Uso de Tokens MCP em 91% (e Aprendi uma Lição Humilhante Sobre Tokenizadores)

Dev.to - MCP·15 de agosto de 2026

O Problema

Quando você adiciona servidores MCP ao seu agente de codificação AI, cada um despeja seu esquema JSON completo no contexto. 255 ferramentas em todos os servidores = 39.964 tokens. Em uma janela de contexto de 128K, isso representa 31% antes de você digitar um único caractere.

Eu estava literalmente pagando pelo overhead da sintaxe JSON. Cada chamada de API incluía {"content":[{"type":"text","text":"..."}]} — 80 tokens para entregar 6 tokens de dados.

A Solução: mcptoon

Eu construí um CLI que fica entre seu agente e os servidores MCP. Ele faz três coisas:

1. Compressão de Esquema (formato SLIM)

Em vez de esquemas JSON completos, mcptoon apresenta ferramentas em um formato compacto delimitado por pipe:

# JSON completo (287 tokens por ferramenta):
{"name":"search","description":"Pesquisar na web","inputSchema":{"type":"object","properties":{"q":{"type":"string","description":"Consulta"},"n":{"type":"number"}},"required":["q"]}}

# Formato SLIM (26 tokens):
search|q:s*|n:n

255 ferramentas: 39.964 → 3.511 tokens. 91% economizados. Verificado com tiktoken.get_encoding("cl100k_base").

2. Descoberta de Zero-Context

Esquemas vivem no disco em ~/.mcptoon/config.json. Seu agente executa mcptoon manifest --slim para ver o que está disponível, então mcptoon call <servidor> <ferramenta> '{"param":"valor"}' --toon para executar. Apenas a saída comprimida entra no contexto.

3. Formato TOON para Resultados

Os resultados das ferramentas retornam como pares chave-valor legíveis por humanos em vez de JSON aninhado:

# Resultado JSON (80 tokens):
{"content":[{"type":"text","text":"{\"name\":\"react\",\"stars\":219000}"}]}

# Resultado TOON (12 tokens):
name: react
stars: 219000

A Lição

Minha primeira versão substituiu null por (o símbolo do conjunto vazio). Eu pensei que estava sendo inteligente. Então alguém passou isso pelo tiktoken: null = 1 token, = 2 tokens. Eu estava literalmente aumentando a contagem de tokens e chamando isso de otimização.

A comunidade HN me chamou a atenção. Justo — eu não havia medido antes de enviar. Agora tudo é verificado pelo tiktoken. true permanece true. null permanece null. Sem truques de unicode.

Impacto no Custo

Com a precificação do GPT-4o ($5/M tokens):

  • Sem mcptoon: 25 requisições × 40K tokens de esquema = 1M tokens = $5
  • Com SLIM: 25 requisições × 3.5K = 87.5K tokens = $0.44
  • Economia diária (100 sessões): ~$540/mês

Começando

pip install mcptoon
mcptoon add fetch --stdio npx -y @anthropic/mcp-fetch
mcptoon manifest --slim    # veja o que está disponível, compacto
mcptoon call fetch fetch '{"url":"https://example.com"}' --toon

Funciona com qualquer agente que pode executar comandos de shell. Um arquivo de configuração para todos os agentes — sem mais reconfigurações para Claude Code vs Cursor vs OpenCode.

3000 linhas de Python, 309 testes, zero dependências.

GitHub: https://github.com/activeing123/mcptoon

O Que Vem a Seguir

  • Mais servidores MCP sendo adicionados à configuração padrão
  • Trabalhando em um rigoroso benchmark de qualidade (atualmente só tenho contagens de tokens, não precisão de LLM)
  • Aberto a feedback sobre o formato SLIM — existe uma codificação melhor?

Qual é o seu maior desperdício de tokens MCP? Como os outros estão lidando com isso?

Contexto Triplo Up

A redução do uso de tokens pode resultar em economias significativas para empresas brasileiras que utilizam agentes de IA. A implementação de soluções como mcptoon pode melhorar a eficiência operacional e reduzir custos com APIs. Isso é especialmente relevante em um cenário onde a otimização de recursos é crucial.

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.