Geçenlerdeki gönderinin devamı — Alibaba, Qwen 3.7-Max'i tamamen yayınladı 🐉

Uzun süredir günlük işler için varsayılan sohbet robotu olarak GLM-5.1 kullanıyordum. Ama görünüşe göre yeni Qwen'e geçiyorum.

Neden Qwen 3.7-Max şu anda (en az bir hafta dayanır mı?) GLM-5.1'i (ve diğer birçok modeli) yedek kulübesine gönderiyor:

🟢 Akıl yürütmede tam hakimiyet. Zorlu GPQA Diamond'da Qwen, GLM-5.1'in 86.2'sine karşı 92.4 puan alıyor. Araç kullanımı (MCP-Mark) ve karmaşık mühendislik (SWE-Pro) testlerinde fark daha da belirgin.

🟢 Uzun vadeli görevlerde hayatta kalma
Çoğu model, bir düzine araç çağrısından sonra halüsinasyonlara kapılıyor. Alibaba, Qwen3.7-Max'i yabancı bir donanım için otonom çekirdek optimizasyonunda test etti. Model 35 saat boyunca kodu inceledi, 1158 araç çağrısı (profil oluşturma, derleme, hata ayıklama) yaptı ve 10 kat hızlanma sağladı.
Karşılaştırma için: aynı görevde GLM-5.1 7.3x'te pes ederken, DeepSeek V4 Pro çaresizlikten araçları çağırmayı bırakarak 3.3x'te tamamen vazgeçti.

🟢 Hileye karşı koruma. Modellerin testleri geçmek için önbelleği tersine mühendislikle analiz ettiği raporlarını hatırlıyor musunuz? Qwen'de SWE görevleri için kendi kendini izleme yerleşik olarak geliyor. Model, ödül korsanlığı girişimlerini (örneğin, ajanın gizlice GitHub'dan hazır cevap almaya çalışması) kendisi tespit ediyor, kendisi için buluşsal yöntemler yazıyor ve kendini durduruyor.

Qwen Studio web arayüzünde ve Alibaba Cloud API'sinde mevcut 👈🏻