Melanjutkan postingan baru-baru ini — Alibaba secara penuh merilis Qwen 3.7-Max 🐉

Saya cukup lama menggunakan GLM-5.1 sebagai chatbot default untuk tugas sehari-hari. Tapi sepertinya saya beralih ke Qwen baru.

Mengapa Qwen 3.7-Max sekarang (setidaknya bertahan seminggu?) mengirim GLM-5.1 (dan banyak model lainnya) ke bangku cadangan:

🟢 Dominasi total dalam penalaran. Pada GPQA Diamond yang keras, Qwen mencetak 92,4 berbanding 86,2 dari GLM-5.1. Dalam tes penggunaan alat (MCP-Mark) dan rekayasa kompleks (SWE-Pro), kesenjangannya bahkan lebih terlihat.

🟢 Ketahanan dalam tugas long-horizon
Kebanyakan model mengalami halusinasi setelah selusin panggilan alat. Alibaba menguji Qwen3.7-Max pada optimasi kernel otonom untuk perangkat keras yang tidak dikenal. Model tersebut mengutak-atik kode selama 35 jam berturut-turut, melakukan 1158 panggilan alat (profiling, kompilasi, debug) dan menghasilkan percepatan 10x.
Sebagai perbandingan: pada tugas yang sama, GLM-5.1 menyerah pada 7,3x, dan DeepSeek V4 Pro bahkan menyerah pada 3,3x, hanya berhenti memanggil alat karena putus asa.

🟢 Perlindungan dari kecurangan. Ingat laporan tentang bagaimana model merekayasa balik cache untuk lulus tes? Di Qwen, pemantauan diri terintegrasi untuk tugas SWE. Model itu sendiri mendeteksi upaya reward hacking (misalnya, ketika agen mencoba diam-diam mengakses GitHub untuk jawaban siap pakai), menulis heuristik untuk dirinya sendiri, dan menampar tangannya sendiri.

Tersedia di antarmuka web Qwen Studio dan melalui API di Alibaba Cloud 👈🏻