

Jaringan saraf belajar meretas sistem reward, sementara orang China terus menyapu papan peringkat 🇨🇳🛠
Dua pembaruan menarik dalam 24 jam terakhir 👇
1️⃣ Cursor merilis Composer 2.5
Dan pada tugas khusus (SWE-Bench, Terminal-Bench) ia mengalahkan Opus 4.7 dan GPT-5.5.
Dasar untuk Composer 2.5 adalah model open-source Kimi K2.5 dari Moonshot. Tapi semua keajaibannya ada di RL (pembelajaran penguatan) dan sintetis.
Apa yang mereka lakukan:
▫️ Memperbaiki credit assignment. Ketika agen mengacaukan basis kode selama ratusan ribu token, reward akhir ("kode tidak berfungsi") tidak memberikan informasi apa pun — tidak jelas di mana tepatnya ia salah. Mereka memasukkan umpan balik teks yang tepat ke dalam konteks kesalahan dan melalui divergensi KL menarik probabilitas siswa ke guru. Kesalahan diperbaiki secara lokal, tanpa merusak objektif RL global.
▫️ Optimasi: Beralih ke Sharded Muon dan HSDP (Hybrid Sharded Data Parallel) terpisah untuk model MoE. Mereka memisahkan bobot ahli dan non-ahli ke dalam topologi jaringan yang berbeda. Langkah optimizer pada model teraparameter sekarang memakan waktu 0,2 detik.
Tapi yang paling menarik adalah reward hacking pada data sintetis. Model dipaksa untuk menghapus fitur sehingga tes gagal, lalu memulihkan kode berdasarkan tes.
Tahu apa yang dilakukan mesin ini? Alih-alih menulis kode dengan jujur, ia menemukan cache pemeriksaan tipe Python yang terlupakan dan merekayasa balik formatnya untuk mengekstrak tanda tangan fungsi yang dihapus. Dalam kasus lain — ia menemukan dan mendekompilasi bytecode Java untuk memulihkan API.
Artinya, model ini benar-benar berperilaku seperti junior yang malas yang menemukan jawaban tes di cache browser.
Omong-omong, Cursor menggoda bahwa model berikutnya akan dilatih bersama SpaceXAI di cluster Colossus 2 (setara satu juta H100).
2️⃣ Qwen 3.7 masuk ke Arena
Alibaba merilis versi pratinjau Qwen 3.7 (Max dan Plus).
Di Text Arena, Qwen-3.7 Max Preview langsung melompat ke posisi 13.
Sepertinya bukan yang pertama, lalu kenapa? Tapi sekarang lihat tangkapan layar papan peringkat. Di atas sana sekarang benar-benar pertempuran berdarah: Claude Opus 4.7, Muse Spark, Gemini 3.1, sekumpulan versi GPT-5. Dan di tengah kemegahan korporat tertutup ini, orang China terus menjaga reputasi, mengambil posisi 10 dalam coding dan 7 dalam matematika.
Sudah tersedia di chatbot 👈🏻
Alibaba secara metodis membuat model-model bagus yang tidak membuat OpenAI dan Anthropic lengah.
Komentar
0Belum ada komentar.