MiniMax M3 : 1M de contexte, Attention Éparse et fin de la gratuité chinoise ☹️

Ils ont sorti MiniMax M3. Selon les benchmarks annoncés (SWE-Bench Pro 59,0%), ils battent Gemini 3.1 Pro, GPT-5.5 et soufflent dans le cou de Claude Opus 4.7. Mais nous savons tous la vraie valeur des benchmarks synthétiques. Ce qui est bien plus intéressant, c'est ce qui se cache sous le capot du modèle et comment les développeurs ont décidé de monétiser cette fête de l'intelligence.

D'un point de vue technique, ils ont fait quelque chose de très cool : ils ont visé un contexte de 1M honnête et fonctionnel. Pour éviter la malédiction de la complexité quadratique de l'attention classique, ils ont dévoilé leur propre architecture — MSA (MiniMax Sparse Attention).
L'idée est un filtrage préalable intelligent : la KV est divisée en blocs, lue exactement une fois, et la mémoire est sollicitée en continu.
👉🏻 En pratique, cela signifie que sur un contexte de 1M, les calculs par token sont 20 fois moins coûteux que sur leur modèle précédent.

Le deuxième point important est l'accent mis sur les tâches agentiques à long terme.
La plupart des tests de code actuels sont des générations uniques de code passe-partout. MiniMax a plutôt entraîné le modèle sur un simulateur interactif de collaboration multi-étapes.
Ils ont forcé M3 à optimiser un noyau CUDA FP8 GEMM pour l'architecture Hopper. À partir de zéro, sans références, seulement la documentation et un squelette non fonctionnel. Le modèle a travaillé pendant 24 heures, effectué 1959 appels d'outils et traversé de nombreux plateaux. Là où d'autres modèles (même le célèbre Opus) se heurtaient à un mur et abandonnaient, M3 continuait à chercher de nouvelles voies d'optimisation et, à la 145e tentative, a produit un résultat, augmentant l'utilisation du matériel de 7,6 % à 71,3 %. La capacité du modèle à garder en mémoire une énorme feuille de logs, de métriques et de morceaux de code échoués — c'est là que le contexte de 1M est vraiment rentable.

Parmi les petites attentions agréables : le mode « thinking » pour les tâches complexes peut être activé ou désactivé dans l'API sans modifier la tarification, et leur application de bureau MiniMax Code fonctionne désormais nativement avec la multimodalité et peut partager votre ordinateur (par exemple, transférer des données d'Excel vers un ERP).

Et maintenant, redescendons sur terre 🛬

Moi-même, j'ai récemment souscrit à leur Token Plan. La raison principale était que c'était tout simplement moins cher. Sur le marché des abonnements, les forfaits à 10 $ ont presque disparu, mais MiniMax en avait un, et pour de nombreuses tâches quotidiennes, il suffisait amplement.

Mais les lois de l'économie unitaire ne se trompent pas. Avec la sortie du nouveau modèle, l'attraction de générosité sans précédent s'est arrêtée. Le forfait à 10 $ a tout simplement été supprimé. Désormais, le seuil d'entrée est le classique 20 $ par mois, et les limites d'utilisation sont devenues nettement plus strictes.

D'abord on casse les prix, on attire le public, puis dès qu'on sort un modèle phare vraiment compétitif, on ferme la boutique et on commence à tondre la base. Eh.