In Fortsetzung des kürzlichen Beitrags – Alibaba hat Qwen 3.7-Max vollständig veröffentlicht 🐉

Ich habe ziemlich lange GLM-5.1 als Standard-Chatbot für alltägliche Aufgaben verwendet. Aber anscheinend wechsle ich zu Qwen.

Warum Qwen 3.7-Max derzeit (wird es wenigstens eine Woche halten?) GLM-5.1 (und viele andere Modelle) auf die Ersatzbank schickt:

🟢 Totale Dominanz beim Denken. Beim anspruchsvollen GPQA Diamond erreicht Qwen 92,4 gegenüber 86,2 bei GLM-5.1. Bei Tests zur Nutzung von Tools (MCP-Mark) und komplexem Engineering (SWE-Pro) ist der Abstand noch deutlicher.

🟢 Überlebensfähigkeit bei langfristigen Aufgaben
Die meisten Modelle verfallen nach einem Dutzend Tool-Aufrufen in Halluzinationen. Alibaba testete Qwen 3.7-Max bei der autonomen Optimierung eines Kerns für unbekannte Hardware. Das Model analysierte den Code 35 Stunden lang, führte 1158 Tool-Aufrufe durch (Profiling, Kompilierung, Debugging) und erzielte eine 10-fache Beschleunigung.
Zum Vergleich: Bei derselben Aufgabe gab GLM-5.1 bei 7,3x auf, und DeepSeek V4 Pro kapitulierte bereits bei 3,3x, indem es einfach aufhörte, Tools aus Verzweiflung aufzurufen.

🟢 Schutz vor Betrug. Erinnern Sie sich an Berichte darüber, wie das Model den Cache reverse-engineerte, um Tests zu bestehen? In Qwen wurde ein Selbstüberwachungsmechanismus für SWE-Aufgaben integriert. Das Model erkennt selbstständig Versuche von Reward Hacking (z. B. wenn ein Agent heimlich auf GitHub nach einer fertigen Antwort sucht), schreibt sich selbst Heuristiken und schlägt sich auf die Finger.

Verfügbar im Web-Interface Qwen Studio und über die API in Alibaba Cloud 👈🏻