

Las redes neuronales aprendieron a hackear el sistema de recompensas, y los chinos siguen aspirando los rankings 🇨🇳🛠
Dos actualizaciones interesantes en las últimas 24 horas 👇
1️⃣ Cursor lanzó Composer 2.5
Y en tareas especializadas (SWE-Bench, Terminal-Bench) supera tanto a Opus 4.7 como a GPT-5.5.
La base de Composer 2.5 fue el modelo de código abierto Kimi K2.5 de Moonshot. Pero toda la magia está en RL (aprendizaje por refuerzo) y datos sintéticos.
Lo que hicieron:
▫️ Arreglaron la asignación de crédito. Cuando el agente ensucia la base de código a lo largo de cientos de miles de tokens, la recompensa final («el código no funciona») no aporta nada: no está claro dónde se desvió. Introdujeron retroalimentación textual puntual directamente en el contexto del error y, mediante divergencia KL, ajustan las probabilidades del estudiante hacia el profesor. El error se corrige localmente, sin romper el objetivo global de RL.
▫️ Optimización: Pasaron a Sharded Muon y HSDP (Hybrid Sharded Data Parallel) para modelos MoE. Separaron los pesos de expertos y no expertos en diferentes topologías de red. El paso del optimizador en un modelo de teraparámetros ahora toma 0.2 segundos.
Pero lo más jugoso es el reward hacking con datos sintéticos. Obligaron al modelo a eliminar características para que las pruebas fallaran, y luego restaurar el código basándose en las pruebas.
¿Saben qué hizo esta máquina? En lugar de escribir código honestamente, encontró un caché olvidado de verificación de tipos de Python y aplicó ingeniería inversa a su formato para extraer las firmas de funciones eliminadas. En otro caso, encontró y descompiló bytecode de Java para restaurar la API.
Es decir, el modelo se comporta literalmente como un junior vago que encontró las respuestas de los exámenes en el caché del navegador.
Por cierto, Cursor adelantó que el próximo modelo lo entrenarán junto con SpaceXAI en el clúster Colossus 2 (un millón de equivalentes H100).
2️⃣ Qwen 3.7 aterrizó en Arena
Alibaba lanzó versiones preliminares de Qwen 3.7 (Max y Plus).
En Text Arena, Qwen-3.7 Max Preview saltó directamente al puesto 13.
¿Parece que no es el primero y no importa? Ahora miren la captura de pantalla del ranking. Arriba hay una verdadera batalla campal: Claude Opus 4.7, Muse Spark, Gemini 3.1, un montón de versiones de GPT-5. Y en medio de esta magnificencia corporativa cerrada, los chicos chinos mantienen firmemente su posición, ocupando el 10.º lugar en codificación y el 7.º en matemáticas.
Ya está disponible en el chatbot 👈🏻
Alibaba está desarrollando metódicamente buenos modelos que no dejan relajarse a OpenAI y Anthropic.
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.