
Gerçeklik karşı saldırıya geçiyor: Yeni benchmark'ta övülen yapay zeka neden %0 alıyor? 🔨
Az önce Jack Clark'ın yaklaşan tekillik ve paramparça olmuş SWE-Bench hakkındaki makalesini okudum; güzel rakamlar vardı: en iyi yapay zekalar SWE-Bench'te %93.9 alıyor, neredeyse tamamen otonom olarak GitHub'daki gerçek sorunları kapatıyor. Görünüşe göre IDE'yi silip barista olmayı öğrenme zamanı gelmişti.
Ama Stanford ve Harvard'dan ekip yeni bir benchmark çıkardı — ProgramBench. Ve bu, mevcut tüm öncü modelleri alenen küçük düşürdü.
Spoiler: GPT-5.4, Claude Opus 4.7 ve Gemini 3.1 Pro'nun sonucu tam olarak %0.
Mesele ne?
Aracıya derlenmiş bir ikili dosya (sıradan jq'den FFmpeg veya SQLite gibi canavarlara kadar) ve belgeler verilir.
Görev: sıfırdan, orijinalin davranışını %100 yeniden üreten bir kod tabanı yazmak.
Ayrı bir komik nokta da, yazarların sanal alanı nasıl çitlemek zorunda kaldığı. Başlangıçta ağ erişimi açıkken, sinir ağları "kod yazmak" yerine sadece --help'i ayrıştırıyor, ilgili depoyu GitHub'da buluyor ve git clone yapıyordu. Ağ kesildiğinde, aracılar paket yöneticileri aracılığıyla kaynak kod indirmeye veya orijinal ikili dosyanın etrafına aptalca bash sarmalayıcıları yazmaya çalıştı.
Bu saçmalığı durdurmak için konteynerler tamamen izole edildi ve ikili dosyalara 111 izni (yalnızca çalıştırma) verildi. Okuma yok. Saf kara kutu tersine mühendislik: girdileri ver, çıktıları izle, herhangi bir Turing tam dilinde uygulamayı yaz.
Ve işte inanılmaz bir şey ortaya çıktı. Bir şey, sinir ağına hazır bir mimariye sahip, sadece 50 satırlık bir yama yazması gereken bir depo vermek. Tamamen başka bir şey de onu bir sistem tasarlamaya zorlamak.
Yapay zeka, et mühendisleri tarafından icat edilen hazır soyutlamalar şeklindeki "koltuk değneklerinden" mahrum kaldığı anda çöküyor. Modellerin sistem tasarımı, ayrıştırma ve arayüz oluşturma konusunda iyi olmadığı ortaya çıkıyor. Kendilerine katı çerçeveler verilmezse, fiziksel olarak sıfırdan bir mimariyi "kafalarında" tutamıyorlar. Ve bu, modellerin bağlam sınırlarına takılmadan tek bir çalıştırmada 5000 dolara kadar yakmasına rağmen böyle.
Kısacası, et torbaları hâlâ savaşabilir. 💪
Yorumlar
0Henüz yorum yok.
Tartışmaya katılmak için giriş yapın.