
MiniMax M3: 1M Konteks, Sparse Attention, dan Akhir dari Gratisan China ☹️
Dirilis MiniMax M3. Berdasarkan tolok ukur yang diklaim (SWE-Bench Pro 59.0%), mereka mengalahkan Gemini 3.1 Pro, GPT-5.5, dan mengincar Claude Opus 4.7. Tapi kita tahu harga sebenarnya dari tolok ukur sintetis. Yang jauh lebih menarik adalah apa yang ada di balik kap model ini, dan bagaimana pengembang memutuskan untuk memonetisasi pesta intelektual ini.
Secara teknis, mereka melakukan hal yang sangat keren — menargetkan konteks 1M yang jujur dan berfungsi. Untuk menghindari kutukan kompleksitas kuadrat dari attention klasik, mereka meluncurkan arsitektur mereka sendiri — MSA (MiniMax Sparse Attention).
Intinya adalah pra-penyaringan yang cerdas: KV dipecah menjadi blok-blok, dibaca tepat satu kali, dan memori diminta secara berkelanjutan.
👉🏻 Dalam praktiknya, ini berarti pada konteks 1M, komputasi per token menjadi 20 kali lebih murah dibandingkan model mereka sebelumnya.
Poin penting kedua adalah fokus pada tugas agen jangka panjang.
Sebagian besar penguji koder saat ini adalah generasi boilerplate satu kali. MiniMax melatih model pada simulator interaktif kolaborasi multi-langkah.
Mereka membuat M3 mengoptimalkan inti FP8 GEMM CUDA untuk arsitektur Hopper. Dari awal, tanpa referensi, hanya dokumentasi dan kerangka yang tidak berfungsi. Model bekerja selama 24 jam, melakukan 1959 panggilan alat, dan melewati banyak dataran tinggi. Di mana model lain (bahkan Opus yang dipuji) menabrak tembok dan berhenti, M3 terus mencari jalur optimasi baru dan pada percobaan ke-145 memberikan hasil, meningkatkan utilisasi perangkat keras dari 7,6% menjadi 71,3%. Kemampuan model untuk menyimpan lembaran besar log, metrik, dan potongan kode yang gagal — di situlah konteks 1M benar-benar terbayar.
Dari hal-hal kecil yang menyenangkan: mode "thinking" untuk tugas kompleks dapat diaktifkan dan dinonaktifkan di API tanpa mengubah tarif, dan aplikasi desktop MiniMax Code mereka sekarang secara native mendukung multimodalitas dan dapat berbagi di komputer Anda (misalnya, mentransfer data dari Excel ke ERP).
Sekarang mari kita turun ke bumi 🛬
Saya sendiri baru saja berlangganan Token Plan mereka. Alasan utamanya adalah karena lebih murah. Di pasar langganan, tarif $10 hampir punah, dan MiniMax memilikinya, dan untuk banyak tugas sehari-hari itu sudah lebih dari cukup.
Tapi hukum ekonomi unit tidak bisa dibohongi. Bersamaan dengan rilis model baru, atraksi kemurahan hati yang belum pernah terjadi sebelumnya ditutup. Tarif $10 dihapus begitu saja. Sekarang ambang masuknya adalah $20 per bulan yang klasik, dan batas penggunaan menjadi jauh lebih ketat.
Pertama dumping, memberi makan audiens, dan begitu model flagship yang benar-benar kompetitif dirilis — tutup toko dan mulai memotong basis. Eh.
Komentar
0Belum ada komentar.
Masuk untuk ikut berdiskusi.