
Yapay zeka ajanları endüstriyel ölçekte teknik borç üretiyor 😬
Herkes SWE-bench ve HumanEval gibi kıyaslamalarla koşturuyor, sinir ağlarının geliştiricilerin yerini almak üzere olduğunu kanıtlıyor. Sorun şu ki bu metrikler yalnızca anlık programlamayı değerlendiriyor. Görev verildi -> Yapay zeka PR çıkardı -> testler yeşil -> zafer, dağılın.
Ama gerçek üretimde, bir kereye mahsus boru hattından geçecek kod yazmak işin yarısı bile değil. Gerçek mühendislik, kodunuzu bir yıl sonra acı çekmeden değiştirebilmektir. İşte burada yapay zeka ciddi şekilde tökezlemeye başlıyor.
Alibaba ve Sun Yat-sen Üniversitesi'ndeki ekip, ajanların yalnızca tek bir izole sorunu kapatmakla kalmayıp, gerçek kod tabanlarını uzun vadede bakımını yapmalarını sağlayan bir makale yayınladı (kıyaslamada proje başına ortalama 233 gün geçmiş ve 71 commit).
SWE-CI'yi oluşturdular — yapay zekanın bir sorunu kapatmak için kod parçası çıkarma yeteneğini değil, projeyi sürdürme yeteneğini değerlendiren ilk kıyaslama.
Aptalca "geçti/kaldı" yerine EvoScore metriğini getirdiler. Teknik borcu cezalandırıyor. 3. iterasyondaki düzeltmeniz, 10. iterasyonda yeni bir özellik eklemeyi imkansız hale getiriyorsa, puanınız uçuruma gidiyor.
Bunun için iki ajan üzerinde CI döngüsü kurdular:
1️⃣
Mimar: Başarısız testlere (test boşlukları) bakar ve üst düzey bir şartname yazar.2️⃣
Programcı: Şartnameyi yerine getirmek için kod yazmaya çalışır.Ve bu böyle devam eder.
Sonuçlar ne?
🟠Sıfır gerileme oranı dibe vurdu. İstikrarın ana göstergesi. Test daha önce geçiyorsa ve commit'inizden sonra başarısız oluyorsa, bu bir gerilemedir. Çoğu övülen LLM'nin gerileme olmama oranı %25'in altında. Yani bir şeyi düzeltmeye çalışırken, 4 vakadan 3'ünde zaten çalışan şeyi bozuyorlar. Sadece Claude Opus %50 eşiğini geçebildi.
🟠Stratejik planlama yok. Kimi ve GLM modelleri (evet, Çinliler LLM'lerini aktif olarak tanıtıyor) hızlı sonuca odaklanmış — anlık olarak mükemmel kod üretiyorlar, ancak uzun vadede kendi miraslarında hızla boğuluyorlar. DeepSeek ve GPT modelleri uzun vadeli oynamaya çalışıyor, ancak yine de tökezliyor.
Kısacası, sinir ağları henüz "bilinçli çaba" gösteremiyor. Olasılıklarla işliyorlar, mimari vizyonla değil. Bir ajana altı ay boyunca bir üretim projesini sürdürmesini verin, onu dokunmaktan korkacağınız bir spagetti canavarına dönüştürecektir.
Yorumlar
0Henüz yorum yok.
Tartışmaya katılmak için giriş yapın.