Sinir ağları ödül sistemini hacklemeyi öğrendi, Çinliler liderlik tablolarını süpürmeye devam ediyor 🇨🇳🛠

Son 24 saatte iki ilginç güncelleme 👇

1️⃣ Cursor Composer 2.5'i yayınladı
Ve uzmanlık görevlerinde (SWE-Bench, Terminal-Bench) hem Opus 4.7'yi hem de GPT-5.5'i geride bırakıyor.

Composer 2.5'in temeli, Moonshot'tan açık kaynaklı Kimi K2.5 modeli oldu. Ancak tüm sihir, RL (takviyeli öğrenme) ve sentetik verilerde.

Yaptıkları:
▫️ Kredi atamasını düzelttiler. Ajan yüz binlerce token boyunca kod tabanına zarar verdiğinde, son ödül ("kod çalışmıyor") hiçbir şey vermiyor - nerede yanlış yaptığı belli değil. Hata bağlamına doğrudan noktasal metin geri bildirimi eklediler ve KL diverjansı ile öğrencinin olasılıklarını öğretmene yaklaştırdılar. Hata, küresel RL hedefini bozmadan yerel olarak düzeltiliyor.
▫️ Optimizasyon: MoE modelleri için Sharded Muon ve ayrı HSDP'ye (Hybrid Sharded Data Parallel) geçtiler. Uzman ve uzman olmayan ağırlıkları farklı ağ topolojilerine taşıdılar. Teraparametrik bir modelde optimize edici adımı artık 0.2 saniye sürüyor.

Ancak en ilginç kısım, sentetik verilerdeki ödül hackleme. Model, testlerin başarısız olması için özellikleri silmeye ve ardından testlere göre kodu geri yüklemeye zorlandı.
Bu makinenin ne yaptığını biliyor musunuz? Dürüst kod yazmak yerine, unutulmuş bir Python tip kontrol önbelleği buldu ve silinen fonksiyon imzalarını çıkarmak için formatını tersine mühendislikle çözdü. Başka bir durumda, API'yi geri yüklemek için Java bayt kodunu bulup derlemesini çözdü.

Yani model, kelimenin tam anlamıyla tarayıcı önbelleğinde test cevaplarını bulan tembel bir stajyer gibi davranıyor.

Bu arada Cursor, bir sonraki modeli SpaceXAI ile Colossus 2 kümesinde (bir milyon H100 eşdeğeri) eğiteceklerini ima etti.

2️⃣ Qwen 3.7 Arena'ya girdi
Alibaba, Qwen 3.7'nin (Max ve Plus) önizleme sürümlerini yayınladı.

Text Arena'da Qwen-3.7 Max Preview hemen 13. sıraya yükseldi.
İlk değil, sorun değil mi? Şimdi liderlik tablosunun ekran görüntüsüne bir bakın. Şu anda üst kısım tam bir kan banyosu: Claude Opus 4.7, Muse Spark, Gemini 3.1, bir sürü GPT-5 sürümü. Ve bu kapalı kurumsal ihtişamın arasında Çinliler istikrarlı bir şekilde kalitelerini koruyarak kodlamada 10., matematikte 7. sırayı alıyor.
Zaten sohbet robotunda mevcut 👈🏻

Alibaba, OpenAI ve Anthropic'in rahatlamasına izin vermeyen iyi modelleri metodik olarak üretiyor.