
Qwen3.6-Plus: agen menjadi lebih pintar, tetapi tolok ukur kembali menipu 🤖
Alibaba merilis Qwen3.6-Plus. Mereka mengklaim bahwa model mereka sangat baik dalam memecahkan masalah di tingkat repositori utuh. Hanya saja, dalam tabel mereka, mereka dengan malu-malu membandingkan dengan GLM-5 dan Opus 4.5, bukan 5.1 dan 4.6.
Jika kita mengambil tolok ukur kerja repositori mereka melalui Claude Code (NL2Repo) dan meletakkan hasil dari GLM-5.1 yang baru dirilis, kita akan melihat:
▫️ Claude Opus 4.6 — 47.9
▫️ GLM-5.1 — 45.3
▫️ Qwen3.6-Plus — 37.9
Untuk pekerjaan serius dengan kode lama dan refaktor besar, GLM-5.1 jauh lebih disukai.
👍 Namun, yang bagus adalah di API mereka menambahkan parameter
preserve_thinking.Bagaimana cara kerjanya sekarang pada yang lain: dalam siklus agen klasik, model pada setiap langkah menghasilkan reasoning (pemikiran), yang kita buang atau berikan kembali, membakar banyak token.
Dengan
preserve_thinking=True, API secara otomatis menyimpan konteks penalaran dari semua langkah dialog sebelumnya. Ini secara radikal mengurangi biaya dan menyelamatkan dari "skizofrenia" agen pada tugas multi-langkah yang panjang. Secara default, parameter ini dimatikan, dilewatkan melalui extra_body dalam permintaan. Catat ini jika Anda membuat agen sendiri.Juga dirilis integrasi dengan OpenClaw, alat CLI Qwen Code, dan dukungan asli untuk format API Anthropic. Artinya, Anda bisa langsung memasang endpoint mereka di Claude Code dan bekerja langsung dari terminal. Plus, jendela konteks default 1M token.
Secara keseluruhan, model multimodal kuat lainnya dengan fitur keren untuk pengembang API dari China, tetapi tanpa "wow".
Di chat juga sudah bisa dicoba. 💬
Kommentare
0Noch keine Kommentare.
Melde dich an, um mitzudiskutieren.