Model open-source refaktor kode lawas 13 jam secara otonom 🤌

Moonshot AI merilis ke open-source Kimi K2.6.

Apa yang menarik dari rilis ini:

1️⃣ Long-Horizon Execution
Dalam blogpost dijelaskan beberapa kasus demonstratif. Pertama: model dipaksa mengoptimalkan inferensi Qwen lokal di Mac. K2.6 melakukan 4000+ panggilan alat dalam 12 jam dan menulis ulang backend ke Zig (Zig, Karl!), meningkatkan throughput 20% lebih tinggi dari LM Studio.
Kedua: refaktor mesin keuangan berusia 8 tahun exchange-core. Model selama 13 jam secara otonom menganalisis flamegraph CPU dan alokasi memori, melakukan lebih dari 1000 panggilan alat, menulis ulang 4000 baris kode, dan mengubah topologi thread. Hasil: throughput meningkat 185%.

2️⃣ Agent Swarms yang ditingkatkan
Arsitektur kini dapat diskalakan secara horizontal hingga 300 sub-agen yang dapat menjalankan hingga 4000 langkah secara paralel. Mereka mendekomposisi tugas sendiri.

3️⃣ Proactive Agents
Tim internal RL-infra Moonshot membiarkan agen berbasis K2.6 selama 5 hari secara otonom mengelola monitoring, merespons insiden, dan memperbaiki sistem. Tanpa campur tangan manusia. Insinyur DevOps, bagaimana kabarnya?

🛠 Model mengalahkan GPT-5.4 (dalam mode xhigh) dan Claude Opus 4.6 (max effort) pada SWE-Bench Pro dan HLE (Humanity's Last Exam).
Jendela konteks — 262k token.
Tersedia kuantisasi INT4 asli, dapat dijalankan melalui vLLM, SGLang, atau KTransformers.

Bobot tersedia di HF: huggingface.co/moonshotai/Kimi-K2.6