Un modèle open source refactorise du code legacy pendant 13 heures en autonomie 🤌

Moonshot AI a publié en open source Kimi K2.6.

Ce qui est intéressant dans cette version :

1️⃣ Exécution à long horizon
Dans le billet de blog, ils décrivent des cas d'usage démonstratifs. Premier cas : le modèle a été chargé d'optimiser l'inférence locale de Qwen sur un Mac. K2.6 a effectué plus de 4000 appels d'outils en 12 heures et réécrit le backend en Zig (Zig, Karl !), augmentant le débit de 20 % par rapport à LM Studio.
Deuxième cas : refactorisation d'un moteur financier vieux de 8 ans, exchange-core. Le modèle a analysé en autonomie pendant 13 heures les flamegraphs CPU et les allocations mémoire, effectué plus de 1000 appels d'outils, réécrit 4000 lignes de code et modifié la topologie des threads. Résultat : le débit a augmenté de 185 %.

2️⃣ Essaims d'agents sous stéroïdes
L'architecture peut désormais être mise à l'échelle horizontalement jusqu'à 300 sous-agents, capables d'exécuter jusqu'à 4000 étapes en parallèle. Ils décomposent eux-mêmes la tâche.

3️⃣ Agents proactifs
L'équipe interne d'infrastructure RL de Moonshot a laissé un agent basé sur K2.6 gérer en autonomie la surveillance, réagir aux incidents et corriger le système pendant 5 jours. Sans intervention humaine. Ingénieurs DevOps, comment ça va ?

🛠 Le modèle bat GPT-5.4 (en mode xhigh) et Claude Opus 4.6 (max effort) sur SWE-Bench Pro et HLE (Humanity's Last Exam).
Fenêtre de contexte : 262k tokens.
Quantification INT4 native, compatible avec vLLM, SGLang ou KTransformers.

Les poids sont disponibles sur HF : huggingface.co/moonshotai/Kimi-K2.6