Qwen3.6-Plus : les agents sont devenus plus malins, mais les benchmarks trichent encore 🤖

Alibaba a lancé Qwen3.6-Plus. Les gars affirment que leur modèle est très bon pour résoudre des problèmes au niveau de dépôts entiers. Seulement, dans leurs tableaux, ils se comparent timidement à GLM-5 et Opus 4.5, et non à 5.1 et 4.6.

Si l'on prend leur propre benchmark de travail avec les dépôts via Claude Code (NL2Repo) et qu'on le met à côté des résultats du récemment sorti GLM-5.1, on voit :
▫️ Claude Opus 4.6 — 47,9
▫️ GLM-5.1 — 45,3
▫️ Qwen3.6-Plus — 37,9

Pour s'attaquer sérieusement au legacy et aux gros refactorings, GLM-5.1 est nettement préférable.

👍 Ce qui est bien, c'est que l'API a introduit le paramètre preserve_thinking.

Comment ça marche actuellement chez les autres : dans le cycle d'agent classique, le modèle génère à chaque étape un raisonnement (ses pensées), qu'on jette ou qu'on réinjecte en brûlant une tonne de tokens.
Avec preserve_thinking=True, l'API conserve automatiquement le contexte de raisonnement de toutes les étapes précédentes du dialogue. Cela réduit radicalement les coûts et évite la « schizophrénie » de l'agent sur les longues tâches multi-étapes. Par défaut, le paramètre est désactivé, il est passé via extra_body dans la requête. Prenez-en note si vous construisez vos propres agents.

Ils ont également lancé une intégration avec OpenClaw, l'outil CLI Qwen Code et un support natif du format d'API Anthropic. Autrement dit, on peut directement insérer leur endpoint dans Claude Code et travailler depuis le terminal. En plus, une fenêtre de contexte par défaut de 1M tokens.

Bref, un autre modèle multimodal solide avec des fonctionnalités intéressantes pour les développeurs d'API venant de Chine, mais sans « wow ».

On peut déjà l'essayer dans le chat. 💬