MiniMax M3: 1M de contexto, Atenção Esparsa e o fim da mamata chinesa ☹️

Lançaram o MiniMax M3. Pelos benchmarks divulgados (SWE-Bench Pro 59,0%), eles superam o Gemini 3.1 Pro, o GPT-5.5 e estão no encalço do Claude Opus 4.7. Mas nós sabemos o verdadeiro valor desses benchmarks sintéticos. Muito mais interessante é o que está por baixo do capô do modelo e como os desenvolvedores decidiram monetizar essa festa de inteligência.

Em termos de engenharia, a equipe fez algo muito legal — eles miraram em um contexto honesto e funcional de 1M. Para evitar a maldição da complexidade quadrática da atenção clássica, eles lançaram sua própria arquitetura — MSA (MiniMax Sparse Attention).
A essência está em uma pré-filtragem inteligente: o KV é dividido em blocos, lido exatamente uma vez, e a memória é acessada de forma contínua.
👉🏻 Na prática, isso significa que, em um contexto de 1M, os cálculos por token ficaram 20 vezes mais baratos do que no modelo anterior.

O segundo ponto importante é o foco em tarefas de agente de longo prazo.
A maioria dos testes atuais de codificação é geração única de boilerplate. Já a MiniMax treinou o modelo em um simulador interativo de colaboração em múltiplas etapas.
Eles fizeram o M3 otimizar um kernel CUDA FP8 GEMM para a arquitetura Hopper. Do zero, sem referências, apenas documentação e um esqueleto não funcional. O modelo trabalhou por 24 horas, fez 1959 chamadas de ferramentas e passou por vários platôs. Onde outros modelos (até mesmo o aclamado Opus) batiam em uma parede e desistiam, o M3 continuava buscando novos caminhos de otimização e, na 145ª tentativa, entregou um resultado, elevando a utilização do hardware de 7,6% para 71,3%. A capacidade do modelo de manter na memória uma enorme quantidade de logs, métricas e trechos de código fracassados — é aí que o contexto de 1M realmente se paga.

Entre os pequenos detalhes interessantes: o modo "thinking" para tarefas complexas pode ser ativado e desativado na API sem alterar a tarifação, e o aplicativo de desktop MiniMax Code agora funciona nativamente com multimodalidade e pode navegar pelo seu computador (por exemplo, transferir dados do Excel para um ERP).

Agora vamos voltar à realidade 🛬

Eu mesmo recentemente assinei o Token Plan deles. O principal motivo é que era simplesmente mais barato. No mercado de assinaturas, os planos de $10 quase desapareceram, e a MiniMax tinha um, que para muitas tarefas do dia a dia era mais que suficiente.

Mas as leis da economia unitária não podem ser enganadas. Junto com o lançamento do novo modelo, o parque de diversões de generosidade sem precedentes fechou. O plano de $10 foi simplesmente removido. Agora o ponto de entrada são os clássicos $20 por mês, e os limites de uso ficaram visivelmente mais rígidos.

Primeiro, fazemos dumping, alimentamos o público, e assim que lançamos um modelo flagship verdadeiramente competitivo, fechamos a loja e começamos a tosquiar a base. Eh.