
Qwen3.6-Plus: agentes ficaram mais espertos, mas os benchmarks estão enganando novamente 🤖
A Alibaba lançou o Qwen3.6-Plus. A equipe afirma que seu modelo é muito bom em resolver problemas no nível de repositórios inteiros. Só que em suas tabelas eles se comparam timidamente com GLM-5 e Opus 4.5, e não com 5.1 e 4.6.
Se pegarmos o benchmark deles de trabalho com repositórios via Claude Code (NL2Repo) e colocarmos ao lado os resultados do recém-lançado GLM-5.1, veremos:
▫️ Claude Opus 4.6 — 47.9
▫️ GLM-5.1 — 45.3
▫️ Qwen3.6-Plus — 37.9
Para trabalhos sérios com legado e grandes refatorações, o GLM-5.1 é muito preferível.
👍 Agora, o que é bom: na API adicionaram o parâmetro
preserve_thinking.Como funciona atualmente nos outros: no ciclo clássico de agente, o modelo gera reasoning (seus pensamentos) a cada passo, que descartamos ou realimentamos, queimando uma tonelada de tokens.
Com
preserve_thinking=True, a API salva automaticamente o contexto de raciocínio de todas as etapas anteriores do diálogo. Isso reduz radicalmente os custos e evita a "esquizofrenia" do agente em tarefas longas de múltiplas etapas. Por padrão, o parâmetro está desligado e é passado via extra_body na requisição. Anote isso se estiver construindo seus próprios agentes.Também lançaram integração com OpenClaw, a ferramenta CLI Qwen Code e suporte nativo ao formato de API da Anthropic. Ou seja, você pode simplesmente colocar o endpoint deles no Claude Code e trabalhar diretamente do terminal. Além disso, a janela de contexto padrão é de 1M tokens.
No geral, mais um modelo multimodal robusto com ótimos recursos para desenvolvedores de API vindo dos chineses, mas sem "uau".
No chat já dá para testar. 💬
Comentários
0Ainda não há comentários.
Entre para participar da conversa.