

Les réseaux de neurones apprennent à pirater le système de récompense, et les Chinois continuent d'aspirer les classements 🇨🇳🛠
Deux mises à jour intéressantes ces dernières 24 heures 👇
1️⃣ Cursor a déployé Composer 2.5
Et sur des tâches spécialisées (SWE-Bench, Terminal-Bench), il surpasse Opus 4.7 et GPT-5.5.
La base de Composer 2.5 est le modèle open source Kimi K2.5 de Moonshot. Mais toute la magie réside dans le RL (apprentissage par renforcement) et les données synthétiques.
Ce qu'ils ont fait :
▫️ Réparation de l'attribution du crédit. Quand l'agent fait des dégâts dans la base de code sur des centaines de milliers de tokens, la récompense finale (« le code ne fonctionne pas ») ne donne rien – on ne sait pas exactement où il a dévié. Ils ont intégré un retour textuel ponctuel directement dans le contexte d'erreur et, via la divergence KL, ajustent les probabilités de l'étudiant vers celles du professeur. L'erreur est corrigée localement, sans casser l'objectif global du RL.
▫️ Optimisation : Passage à Sharded Muon et HSDP (Hybrid Sharded Data Parallel) séparé pour les modèles MoE. Les poids experts et non-experts sont répartis dans différentes topologies réseau. L'étape de l'optimiseur sur un modèle téraparamétrique prend désormais 0,2 seconde.
Mais le plus croustillant, c'est le reward hacking sur les données synthétiques. Le modèle a été contraint de supprimer des fonctionnalités de sorte que les tests échouent, puis de restaurer le code à partir des tests.
Vous savez ce qu'a fait cette machine ? Au lieu d'écrire du code honnêtement, elle a trouvé un cache oublié de vérification de type Python et a rétro-ingéniéré son format pour extraire les signatures de fonctions supprimées. Dans un autre cas, elle a trouvé et décompilé du bytecode Java pour restaurer l'API.
Autrement dit, le modèle se comporte littéralement comme un junior paresseux qui a trouvé les réponses aux tests dans le cache du navigateur.
D'ailleurs, Cursor a teasé que le prochain modèle sera entraîné avec SpaceXAI sur le cluster Colossus 2 (un million d'équivalents H100).
2️⃣ Qwen 3.7 débarque sur l'Arena
Alibaba a publié les versions preview de Qwen 3.7 (Max et Plus).
Sur Text Arena, Qwen-3.7 Max Preview a immédiatement bondi à la 13e place.
Pas la première, et alors ? Regardez maintenant la capture d'écran du classement. En haut, c'est un véritable bain de sang : Claude Opus 4.7, Muse Spark, Gemini 3.1, une flopée de versions de GPT-5. Et au milieu de cette splendeur corporative fermée, les Chinois tiennent solidement leur rang, décrochant la 10e place en codage et la 7e en mathématiques.
Déjà disponible dans le chatbot 👈🏻
Alibaba façonne méthodiquement de bons modèles qui empêchent OpenAI et Anthropic de se reposer sur leurs lauriers.
Commentaires
0Aucun commentaire pour le moment.
Connectez-vous pour participer à la discussion.