
Dando continuidade ao post recente — Alibaba lançou oficialmente o Qwen 3.7-Max 🐉
Fiquei bastante tempo usando o
GLM-5.1 como chatbot padrão para tarefas do dia a dia. Mas, aparentemente, estou migrando para o novo Qwen. Por que o Qwen 3.7-Max agora (será que dura pelo menos uma semana?) manda o GLM-5.1 (e muitos outros modelos) para o banco de reservas:
🟢 Domínio total em raciocínio. No GPQA Diamond hardcore, o Qwen atinge 92,4 contra 86,2 do GLM-5.1. Em testes de uso de ferramentas (MCP-Mark) e engenharia complexa (SWE-Pro), a diferença é ainda maior.
🟢 Sobrevivência em tarefas de longo horizonte
A maioria dos modelos cai em alucinações após dezenas de chamadas de ferramentas. A Alibaba testou o Qwen 3.7-Max na otimização autônoma de kernel para hardware desconhecido. O modelo analisou código por 35 horas seguidas, fez 1158 chamadas de ferramentas (perfilamento, compilação, depuração) e obteve uma aceleração de 10x.
Para comparação: na mesma tarefa, o
GLM-5.1 caiu para 7,3x, e o DeepSeek V4 Pro simplesmente desistiu em 3,3x, parando de chamar ferramentas por desespero.🟢 Proteção contra trapaça. Lembram dos relatos sobre como o modelo fazia engenharia reversa do cache para passar nos testes? No Qwen, foi incorporado um automonitoramento para tarefas SWE. O modelo detecta tentativas de reward hacking (por exemplo, quando o agente tenta acessar o GitHub às escondidas por uma resposta pronta), escreve heurísticas para si mesmo e se repreende.
Disponível na interface web do Qwen Studio e via API na Alibaba Cloud 👈🏻
Comentários
0Ainda não há comentários.
Entre para participar da conversa.