MiniMax M3: 1M de contexto, Atención Dispersa y el fin de la ganga china ☹️

Lanzaron MiniMax M3. Según los benchmarks declarados (SWE-Bench Pro 59.0%) superan a Gemini 3.1 Pro, GPT-5.5 y están pisándole los talones a Claude Opus 4.7. Pero nosotros sabemos el precio real de las métricas sintéticas. Mucho más interesante es lo que hay bajo el capó del modelo y cómo los desarrolladores decidieron monetizar esta fiesta de inteligencia.

Ingenierilmente, los chicos hicieron algo genial: apuntaron a un contexto honesto y funcional de 1M. Para evitar la maldición de la complejidad cuadrática de la atención clásica, lanzaron su propia arquitectura: MSA (MiniMax Sparse Attention).
La esencia está en un filtrado previo inteligente: la KV se divide en bloques, se lee exactamente una vez y la memoria se solicita de forma continua.
👉🏻 En la práctica, esto significa que en un contexto de 1M, los cálculos por token se han vuelto 20 veces más baratos que en su modelo anterior.

El segundo punto importante es el enfoque en tareas de agente a largo plazo.
La mayoría de las pruebas actuales de codificadores son generación única de boilerplate. MiniMax, en cambio, entrenó el modelo en un simulador interactivo de colaboración multi-paso.
Hicieron que M3 optimizara el núcleo CUDA FP8 GEMM para la arquitectura Hopper. Desde cero, sin referencias, solo documentación y un esqueleto que no funcionaba. El modelo estuvo dándole durante 24 horas, hizo 1959 llamadas a herramientas y pasó por una gran cantidad de mesetas. Donde otros modelos (incluso el alabado Opus) chocaban contra una pared y se rendían, M3 seguía buscando nuevas rutas de optimización y en el intento 145 logró un resultado, elevando la utilización del hardware del 7.6% al 71.3%. La capacidad del modelo para mantener en memoria una enorme hoja de registros, métricas y fragmentos de código fallidos — ahí es donde el contexto de 1M realmente se amortiza.

Entre los pequeños detalles agradables: el modo "thinking" para tareas complejas se puede activar y desactivar en la API sin cambiar la tarificación, y su aplicación de escritorio MiniMax Code ahora funciona de forma nativa con multimodalidad y puede compartir su computadora (por ejemplo, transferir datos de Excel a ERP).

Y ahora bajemos a la tierra 🛬

Yo mismo me suscribí recientemente a su Token Plan. La razón principal era que era simplemente más barato. En el mercado de suscripciones casi habían desaparecido los planes de $10, y MiniMax los tenía, y para muchas tareas cotidianas era más que suficiente.

Pero las leyes de la economía unitaria no se engañan. Junto con el lanzamiento del nuevo modelo, la atracción de generosidad sin precedentes se cerró. El plan de $10 simplemente fue eliminado. Ahora el umbral de entrada son los clásicos $20 al mes, y los límites de uso se han vuelto notablemente más estrictos.

Primero hacemos dumping, alimentamos a la audiencia, y tan pronto como lanzamos un modelo insignia realmente competitivo, cerramos el chiringuito y empezamos a esquilar la base. Eh.