Suite à un post récent — Alibaba a déployé Qwen 3.7-Max 🐉

J'ai longtemps utilisé GLM-5.1 comme chatbot par défaut pour les tâches quotidiennes. Mais apparemment, je passe au nouveau Qwen.

Pourquoi Qwen 3.7-Max envoie-t-il actuellement (au moins pour une semaine ?) GLM-5.1 (et bien d'autres modèles) sur le banc de touche :

🟢 Domination totale dans le raisonnement. Sur le difficile GPQA Diamond, Qwen obtient 92,4 contre 86,2 pour GLM-5.1. Dans les tests d'utilisation d'outils (MCP-Mark) et d'ingénierie complexe (SWE-Pro), l'écart est encore plus marqué.

🟢 Survie dans les tâches à long horizon
La plupart des modèles tombent dans les hallucinations après une dizaine d'appels d'outils. Alibaba a testé Qwen 3.7-Max sur l'optimisation autonome d'un noyau pour un matériel inconnu. Le modèle a fouillé le code 35 heures d'affilée, effectué 1158 appels d'outils (profilage, compilation, débogage) et obtenu une accélération de 10x.
À titre de comparaison : sur la même tâche, GLM-5.1 a plafonné à 7,3x, et DeepSeek V4 Pro a abandonné à 3,3x, cessant simplement d'appeler les outils par désespoir.

🟢 Protection contre la triche. Vous souvenez-vous des rapports sur la façon dont le modèle faisait du reverse engineering du cache pour réussir les tests ? Qwen intègre un auto-monitoring pour les tâches SWE. Le modèle détecte lui-même les tentatives de reward hacking (par exemple, quand un agent essaie discrètement d'aller sur GitHub chercher une réponse toute faite), écrit ses propres heuristiques et se tape sur les doigts.

Disponible dans l'interface web Qwen Studio et via l'API Alibaba Cloud 👈🏻