Voltar as noticias
Melhor LLM Open-Source para Codificação: Nossa Escolha é Qwen3-Coder
Compartilhar
MCP ProtocolMediaEN

Melhor LLM Open-Source para Codificação: Nossa Escolha é Qwen3-Coder

Fonte original: Dev.to - LLMs·13 de setembro de 2026

Curadoria, tradução e análise: Redação Triplo Hub.

Veredicto: baixe Qwen3-Coder-480B-A35B-Instruct se você quer uma resposta. Ele possui uma licença Apache-2.0 simples, e a pontuação mais frequentemente citada para ele é 69,6% no SWE-bench Verified, a mais alta reportada para um modelo de codificação com licença aberta. Escolha GLM-5.2 em vez disso se seu trabalho envolver execuções de agentes de longo prazo em todo um repositório, porque é aí que se reporta que ele se destaca. Escolha DeepSeek-V3.2 se o custo de inferência for a restrição principal.

Essa é a resposta completa. O restante desta página explica por que cada lista de "melhores LLMs de código de código aberto" que você encontra diz algo diferente, e por que a discordância importa menos do que parece.

À primeira vista

  • Escolha padrão: Qwen3-Coder-480B-A35B-Instruct. Apache-2.0, mistura de especialistas, 480B de parâmetros totais com 35B ativos por token.
  • Escolha agentica: GLM-5.2, licença MIT, pesos abertos publicados no Hugging Face.
  • Escolha de custo: DeepSeek-V3.2.
  • Por que as listas entram em conflito: elas citam diferentes benchmarks. SWE-bench Verified, SWE-bench Pro e Terminal-Bench são três testes separados, e um modelo pode liderar um e não os outros.
  • O que não muda de semana para semana: a licença e se os pesos se ajustam ao seu hardware. Decida sobre isso.
  • Última verificação: 2026-08-19.

Por que os rankings discordam?

Porque eles não estão medindo a mesma coisa, e quase nenhum deles diz isso.

SWE-bench Verified é um conjunto filtrado por humanos de tarefas reais de resolução de problemas do GitHub, descrito pela Modal como 500 tarefas. SWE-bench Pro é um conjunto separado e mais difícil. Terminal-Bench pontua trabalho em shell e ferramentas em vez de geração de patches. Um modelo ajustado para longas execuções de agentes pode liderar no Terminal-Bench e ficar no meio da tabela no Verified, e ambas as afirmações são verdadeiras ao mesmo tempo.

Os números também mudam com o harness. Um ranking publicado dá a Qwen3-Coder-480B 69,6% no SWE-bench Verified, DeepSeek-V3.2 aproximadamente 70%, MiniMax-M2 69,4% e Kimi K2 71,6% sob múltiplas tentativas agenticas - e essa última qualificação está fazendo muito trabalho. Múltiplas tentativas significam que o modelo teve mais de uma chance. Comparar uma figura de múltiplas tentativas com uma de tentativas únicas não é uma comparação válida.

Portanto, a leitura honesta é que os melhores codificadores de pesos abertos estão agrupados dentro de alguns pontos uns dos outros no mesmo teste, e a ordem muda com o harness. Uma vez que isso é verdade, os critérios de desempate não são as pontuações de benchmark.

Qwen3-Coder-480B: a escolha padrão

As próprias notas de lançamento da Qwen descrevem Qwen3-Coder-480B-A35B-Instruct como estabelecendo resultados de ponta entre modelos abertos em codificação agentica, uso de navegador e uso de ferramentas, comparáveis a um modelo fechado de fronteira de sua geração.

Duas razões práticas para ser a escolha padrão aqui.

A licença é Apache-2.0. Sem gatilho de receita, sem exclusões de jurisdição, sem anexo de uso aceitável para contornar sua equipe jurídica. Isso importa mais do que dois pontos de benchmark se você enviar um produto em cima disso.

Está em toda parte. O modelo é servido pelos principais provedores de inferência e possui um cartão de modelo AWS Bedrock, bem como uma listagem NIM da NVIDIA, para que você possa começar em uma API e depois passar para seu próprio hardware sem mudar de modelo.

O problema é o tamanho. 480B de parâmetros totais é um modelo de GPU alugada, não um modelo de laptop. A contagem de parâmetros ativos de 35B reduz o cálculo por token, mas não a memória que você precisa para armazenar os pesos.

GLM-5.2: escolha isso para longas execuções de agentes

GLM-5.2 é o modelo de peso aberto da Z.ai, publicado sob a licença MIT no Hugging Face. Entre o trio aberto atual, é o que se reporta que lidera no SWE-bench Pro e opera a quase três vezes a taxa de transferência de seus pares.

Esse número de taxa de transferência é o subestimado. Um agente que edita, executa testes, lê a falha e edita novamente passa a maior parte do seu tempo em relógio esperando por tokens. Um modelo que é ligeiramente mais fraco por tentativa, mas três vezes mais rápido, pode concluir mais loops na mesma hora, e concluir loops é o que fecha um ticket.

Uma rodada independente chega à mesma divisão que nós, chamando GLM-5.2 sua escolha geral para agentes de codificação de longo prazo e trabalho em repositório, com Qwen3-Coder escolhido quando os termos Apache-2.0 são a prioridade.

DeepSeek-V3.2: escolha isso pelo custo

O cartão de modelo do DeepSeek-V3.2 descreve um mecanismo de atenção esparsa, DeepSeek Sparse Attention, que reduz o custo do trabalho de longo contexto enquanto mantém a qualidade de saída, e afirma paridade com um modelo fechado de fronteira de sua geração.

Para codificação especificamente, a razão para optar por ele é o preço por tarefa resolvida em vez da capacidade máxima. Se sua carga de trabalho for de alto volume e repetitiva - geração de testes, edições de migração, correções de lint em milhares de arquivos - o modelo mais barato que está um ponto atrás é a escolha correta, e não está nem perto.

A comparação, sobre as coisas que não mudam

Qwen3-Coder-480B GLM-5.2 DeepSeek-V3.2
Licença Apache-2.0 MIT Licença do modelo DeepSeek
Formato MoE, 480B total / 35B ativo MoE, pesos abertos no Hugging Face MoE com atenção esparsa
Mais forte reportado em SWE-bench Verified entre modelos com licença aberta SWE-bench Pro, taxa de transferência eficiência de custo de longo contexto
Executa em uma única estação de trabalho Não Não Não
Melhor para enviar um produto com pesos abertos longas execuções de agentes em um repositório trabalho de alto volume e sensível ao custo

Você pode executar algum desses em sua própria máquina?

Não com pesos completos. Todos os três são modelos de mistura de especialistas na casa das centenas de bilhões de parâmetros, e a memória para armazenar os pesos é a parede, não o cálculo.

O que roda localmente são os membros menores das mesmas famílias, quantizados. Essa é uma decisão genuinamente diferente com uma resposta diferente, e tratar um modelo de 480B e um modelo de 27B como concorrentes é o erro mais comum nesta categoria. Se local é sua verdadeira restrição, comece do que cabe na sua VRAM e só então compare a qualidade.

O que não faríamos

Não escolheríamos com base em uma única linha de leaderboard. O cluster no topo é apertado, os harnesses diferem, e a ordem mudou mais de uma vez este ano.

Também não escolheríamos um modelo cuja licença você não leu. "Código aberto" é usado de forma solta aqui: vários modelos amplamente recomendados são pesos abertos em vez de código aberto OSI, o que significa que você pode baixá-los e executá-los sob termos que não são uma das licenças permissivas padrão. Apa

Análise editorial da Triplo Hub

O artigo analisa modelos de LLM open-source que podem impactar o desenvolvimento de software no Brasil. Com a crescente adoção de IA, escolher o modelo certo pode otimizar processos de codificação e reduzir custos. Empresas devem considerar a licença e a eficiência ao selecionar um modelo.

Compartilhar
Seguir @triploup

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.