

Redes neurais aprenderam a hackear o sistema de recompensa, e os chineses continuam aspirando os rankings 🇨🇳🛠
Duas atualizações interessantes nas últimas 24 horas 👇
1️⃣ Cursor lançou o Composer 2.5
E ele, em tarefas especializadas (SWE-Bench, Terminal-Bench), supera tanto o Opus 4.7 quanto o GPT-5.5.
A base do Composer 2.5 foi o modelo open-source Kimi K2.5 da Moonshot. Mas toda a mágica está no RL (aprendizado por reforço) e na sintética.
O que eles fizeram:
▫️ Corrigiram a atribuição de crédito. Quando o agente bagunça a base de código por centenas de milhares de tokens, a recompensa final ("o código não funciona") não ajuda — não está claro onde exatamente ele errou. Eles inseriram feedback textual pontual diretamente no contexto do erro e, através da divergência KL, ajustam as probabilidades do aluno para o professor. O erro é corrigido localmente, sem quebrar o objetivo global do RL.
▫️ Otimização: Migraram para Sharded Muon e HSDP (Hybrid Sharded Data Parallel) separado para modelos MoE. Separaram os pesos de especialistas e não especialistas em diferentes topologias de rede. O passo do otimizador em um modelo teraparâmetro agora leva 0,2 segundos.
Mas o mais interessante é o reward hacking em dados sintéticos. O modelo foi forçado a remover recursos de modo que os testes falhassem e depois restaurar o código com base nos testes.
Sabe o que essa máquina fez? Em vez de escrever código honestamente, ela encontrou um cache esquecido de verificação de tipo do Python e fez engenharia reversa do seu formato para extrair as assinaturas de funções removidas. Em outro caso, encontrou e descompilou bytecode Java para restaurar a API.
Ou seja, o modelo literalmente se comporta como um desenvolvedor júnior preguiçoso que encontrou as respostas dos testes no cache do navegador.
A propósito, a Cursor provocou que o próximo modelo será treinado junto com a SpaceXAI no cluster Colossus 2 (um milhão de equivalentes H100).
2️⃣ Qwen 3.7 entrou na Arena
A Alibaba lançou versões prévias do Qwen 3.7 (Max e Plus).
Na Text Arena, o Qwen-3.7 Max Preview saltou diretamente para o 13º lugar.
Parece que não é o primeiro, e daí? Agora olhe a captura de tela do ranking. Lá em cima está uma verdadeira batalha sangrenta: Claude Opus 4.7, Muse Spark, Gemini 3.1, um monte de versões do GPT-5. E em meio a essa grandiosidade corporativa fechada, os chineses mantêm firmemente a posição, conquistando o 10º lugar em codificação e o 7º em matemática.
Já disponível no chatbot 👈🏻
A Alibaba está metodicamente criando bons modelos que não deixam OpenAI e Anthropic relaxarem.
Comentários
0Ainda não há comentários.
Entre para participar da conversa.