Ufukta Tekillik: Kod Yazan Kodu Eğiten Kod 🔮

Jack Clark (Anthropic'in kurucu ortağı) AI endüstrisinin mevcut durumuna dair bir analiz makalesi yayınladı.

Ana tezi: 2028 sonuna kadar %60'tan fazla olasılıkla tamamen otomatikleştirilmiş bir Ar-Ge döngüsü göreceğiz. Yani en iyi model, et torbalarının katılımı olmadan bir sonraki daha akıllı versiyonunu otonom olarak eğitebilecek.

Kulağa ucuz bir bilim kurgu gibi geliyor, ancak Clark her şeyi metriklerle açıklıyor. Toplu benchmark verilerine bakıldığında, insan yeterliliğinin ufkunun ne kadar hızlı daraldığı biraz rahatsız edici.

1️⃣ Mühendislik benchmark'larının doygunluğu
SWE-Bench (GitHub'daki gerçek sorunları çözme). 2023 sonunda en iyi sonuç Claude 2 ile %2 gibi acınası bir seviyedeydi. Şimdi Claude Mythos Preview %93.9'a ulaşıyor. Aslında benchmark geçildi.
Otonomi süresi (METR) 2023'te GPT-4 için 4 dakikadan bugün Opus 4.6 için 12 saate çıktı. Bu, sigara molası vermeyen bir orta seviye çalışanın tam bir iş gününe denk. 2026 sonuna kadar 100 saate sıçrama bekleniyor. Bu, sinir ağının sadece bir hatayı düzeltmekle kalmayıp, siz başka bir şeyle meşgulken hizmetin mimarisini yeniden yazması için yeterli.

2️⃣ Veri bilimcilerin rutin işlerinin otomasyonu
MLE-Bench benchmark'ı (çevrimdışı Kaggle yarışmaları). Gemini3 tabanlı en iyi sistem %64.4 başarı elde ediyor.
CORE-Bench (bilimsel ML makalelerinin depodan yeniden üretimi). Model bağımlılıkları kendisi kuruyor, ortamı hazırlıyor, kodu çalıştırıyor ve sonuçları kontrol ediyor. Puan: %95.5.

3️⃣ En önemlisi: Yapay zeka zorlu optimizasyona giriyor
Sinir ağları GPU çekirdekleri (Triton/CUDA) yazmayı ve optimize etmeyi öğrendi. Anthropic, modellerin CPU'da LLM eğitimi için kodu nasıl optimize ettiğini ölçüyor. Bir yılda hızlanma 2.9x'ten (Opus 4) 52x'e (Claude Mythos Preview) çıktı. Bir insanın bu sonuca ulaşması tam bir iş günü alır.
PostTrainBench ortaya çıktı; büyük modeller küçük açık kaynak ağırlıkları ince ayar yapıyor. Şu anda AI ajanları, en iyi laboratuvarlardaki yetenekli ML mühendislerinin performansının yaklaşık %50'sini veriyor.

Evet, modeller henüz yeni paradigmalar (transformers gibi) yaratmak için gereken "yaratıcılığa" sahip değil, ancak buna ihtiyaçları da yok. AI ajanlarından oluşan otonom ekipler aracılığıyla kapsamlı ölçeklendirme fazlasıyla yeterli olacaktır.

Her şey, büyük şirketlerin sermaye açısından "büyük" (çok GPU'ya ihtiyaç var) ancak insan sayısı açısından çok küçük olmasına yol açabilir. 50 mühendislik bir ekip yerine, tükenmeyen ve ışık hızında kod yazan 500 sentetik ajandan oluşan bir sürüyü yöneten bir mimar neden olmasın? Tabii her şey ideal senaryoya göre giderse ve kara kuğular olmazsa.

İnanıyor musunuz?