Voltar as noticias
Avalie sua carga de trabalho antes de trocar de fornecedores de LLM
MCP ProtocolMediaEN

Avalie sua carga de trabalho antes de trocar de fornecedores de LLM

Dev.to - MCP·6 de agosto de 2026

TL;DR: Antes de migrar nosso agente de voz do Claude Sonnet, executamos os
novos níveis do GPT-5.6 através do mesmo benchmark de roteamento de ferramentas que o incumbente utiliza:
13 solicitações reais, 74 esquemas de ferramentas MCP, avaliados se o modelo chama as ferramentas certas.
O GPT-5.6 obteve 38,5% contra 92,3% do Sonnet em nossa carga de trabalho, sob nossas
restrições de integração
— então, sem migração. Vá direto para os números.
A parte transferível não é a pontuação, é o método.

O que isso não é — leia isso antes dos números. Isso é não um benchmark de modelo,
e não diz nada sobre a qualidade geral do GPT-5.6. É um teste estreito,
específico para carga de trabalho: um modelo candidato, inserido em nosso
fluxo de integração (um executor compatível com OpenAI /v1/chat/completions, que
força reasoning_effort: "none" quando ferramentas estão presentes — mais sobre isso abaixo),
consegue direcionar as solicitações de um agente de voz para as ferramentas certas em nossa superfície de 74 ferramentas MCP?
A história completa de chamadas de ferramentas do GPT-5.6 está na API de Respostas, que nosso executor
não fala. O resultado não se generaliza para nada além de "não é uma troca direta para
este sistema, hoje." Se você levar uma pontuação de destaque deste post, você leu errado. Leve o método.

A tentação

Toda vez que um novo modelo principal é lançado, a mesma pergunta aparece: devemos
migrar?
As tabelas de classificação parecem ótimas. Os preços parecem ótimos. Os posts no blog
são elogiosos.

Nada disso mede sua carga de trabalho.

Nossa carga de trabalho é um agente de voz em um barco. A arquitetura empurra o determinismo
para o código — a frase falada é um template, os resultados das ferramentas são formatados na
layer de ferramentas, a composição acontece em ferramentas compostas. O trabalho real do LLM é
narrow: ouvir uma solicitação, escolher a(s) ferramenta(s) MCP certa(s), chamá-las com argumentos
trabalháveis.
"Qual é a corrente em Boundary Pass?" deve ser direcionado para
currents.get_gate_current, não para uma leitura de sensor genérica. É isso. O pico
de raciocínio não está no caminho crítico; a correção do roteamento de ferramentas e a latência
são.

Nenhuma pontuação pública de leaderboard "roteia corretamente através de nossos 74 esquemas de ferramentas
marítimas MCP." Então, construímos o banco uma vez, e agora cada modelo candidato passa pelo
mesmo teste de 15 minutos antes que qualquer conversa de migração seja permitida a continuar.

A regra de decisão

A regra de troca está escrita como código, não como vibrações. Um candidato substitui o
incumbente apenas se for mais rápido e mantiver a correção dentro da tolerância e for
estável:

def compare(incumbent: Scorecard, candidate: Scorecard, eps: float = 0.05) -> Verdict:
    if candidate.error_rate > 0:
        return Verdict(False, f"candidato não está estável na sessão "
                              f"(taxa_de_erro={candidate.error_rate:.2f})")
    if candidate.latency_p50 >= incumbent.latency_p50:
        return Verdict(False, f"candidato não é mais rápido "
                              f"(p50 {candidate.latency_p50:.2f}s vs "
                              f"incumbente {incumbent.latency_p50:.2f}s)")
    if candidate.correctness < incumbent.correctness - eps:
        return Verdict(False, f"candidato com correção abaixo da tolerância "
                              f"({candidate.correctness:.2f} < "
                              f"{incumbent.correctness:.2f} - {eps})")
    return Verdict(True, ...)

Note o que isso otimiza: velocidade em uma barra de correção, não capacidade máxima.
Nós queremos ser persuadidos por um modelo mais rápido. O loop de voz tem um alvo de aquecimento de <5 s;
a p50 do incumbente é superior a 8 s. Um candidato que é 3× mais rápido e
roteia ferramentas corretamente ganha a vaga imediatamente. A barra é a correção do incumbente menos ε, porque a qualidade da prosa é determinística a montante — o
modelo só precisa conectar as ferramentas certas.

O suporte

O banco (python -m poseidon.bench em
naturali-agents) conduz um
conjunto padrão de 13 solicitações, cada uma anotada com a ferramenta esperada.

Contexto Triplo Up

O artigo destaca a importância de avaliar a compatibilidade de modelos de LLM com cargas de trabalho específicas antes de realizar migrações. Para empresas brasileiras, isso pode significar economizar tempo e recursos ao escolher a tecnologia certa para suas necessidades.

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.