
Avalie sua carga de trabalho antes de trocar de fornecedores de LLM
TL;DR: Antes de migrar nosso agente de voz do Claude Sonnet, executamos os
novos níveis do GPT-5.6 através do mesmo benchmark de roteamento de ferramentas que o incumbente utiliza:
13 solicitações reais, 74 esquemas de ferramentas MCP, avaliados se o modelo chama as ferramentas certas.
O GPT-5.6 obteve 38,5% contra 92,3% do Sonnet em nossa carga de trabalho, sob nossas
restrições de integração — então, sem migração. Vá direto para os números.
A parte transferível não é a pontuação, é o método.
O que isso não é — leia isso antes dos números. Isso é não um benchmark de modelo,
e não diz nada sobre a qualidade geral do GPT-5.6. É um teste estreito,
específico para carga de trabalho: um modelo candidato, inserido em nosso
fluxo de integração (um executor compatível com OpenAI /v1/chat/completions, que
força reasoning_effort: "none" quando ferramentas estão presentes — mais sobre isso abaixo),
consegue direcionar as solicitações de um agente de voz para as ferramentas certas em nossa superfície de 74 ferramentas MCP?
A história completa de chamadas de ferramentas do GPT-5.6 está na API de Respostas, que nosso executor
não fala. O resultado não se generaliza para nada além de "não é uma troca direta para
este sistema, hoje." Se você levar uma pontuação de destaque deste post, você leu errado. Leve o método.
A tentação
Toda vez que um novo modelo principal é lançado, a mesma pergunta aparece: devemos
migrar? As tabelas de classificação parecem ótimas. Os preços parecem ótimos. Os posts no blog
são elogiosos.
Nada disso mede sua carga de trabalho.
Nossa carga de trabalho é um agente de voz em um barco. A arquitetura empurra o determinismo
para o código — a frase falada é um template, os resultados das ferramentas são formatados na
layer de ferramentas, a composição acontece em ferramentas compostas. O trabalho real do LLM é
narrow: ouvir uma solicitação, escolher a(s) ferramenta(s) MCP certa(s), chamá-las com argumentos
trabalháveis. "Qual é a corrente em Boundary Pass?" deve ser direcionado para
currents.get_gate_current, não para uma leitura de sensor genérica. É isso. O pico
de raciocínio não está no caminho crítico; a correção do roteamento de ferramentas e a latência
são.
Nenhuma pontuação pública de leaderboard "roteia corretamente através de nossos 74 esquemas de ferramentas
marítimas MCP." Então, construímos o banco uma vez, e agora cada modelo candidato passa pelo
mesmo teste de 15 minutos antes que qualquer conversa de migração seja permitida a continuar.
A regra de decisão
A regra de troca está escrita como código, não como vibrações. Um candidato substitui o
incumbente apenas se for mais rápido e mantiver a correção dentro da tolerância e for
estável:
def compare(incumbent: Scorecard, candidate: Scorecard, eps: float = 0.05) -> Verdict:
if candidate.error_rate > 0:
return Verdict(False, f"candidato não está estável na sessão "
f"(taxa_de_erro={candidate.error_rate:.2f})")
if candidate.latency_p50 >= incumbent.latency_p50:
return Verdict(False, f"candidato não é mais rápido "
f"(p50 {candidate.latency_p50:.2f}s vs "
f"incumbente {incumbent.latency_p50:.2f}s)")
if candidate.correctness < incumbent.correctness - eps:
return Verdict(False, f"candidato com correção abaixo da tolerância "
f"({candidate.correctness:.2f} < "
f"{incumbent.correctness:.2f} - {eps})")
return Verdict(True, ...)
Note o que isso otimiza: velocidade em uma barra de correção, não capacidade máxima.
Nós queremos ser persuadidos por um modelo mais rápido. O loop de voz tem um alvo de aquecimento de <5 s;
a p50 do incumbente é superior a 8 s. Um candidato que é 3× mais rápido e
roteia ferramentas corretamente ganha a vaga imediatamente. A barra é a correção do incumbente menos ε, porque a qualidade da prosa é determinística a montante — o
modelo só precisa conectar as ferramentas certas.
O suporte
O banco (python -m poseidon.bench em
naturali-agents) conduz um
conjunto padrão de 13 solicitações, cada uma anotada com a ferramenta esperada.
O artigo destaca a importância de avaliar a compatibilidade de modelos de LLM com cargas de trabalho específicas antes de realizar migrações. Para empresas brasileiras, isso pode significar economizar tempo e recursos ao escolher a tecnologia certa para suas necessidades.
