Anthropic, Senior seviyesinde kod yazan bir yapay zeka eğitti ve kendi yarattıklarından korktular 🛑

Anthropic, Project Glasswing duyurusunu ve 244 sayfalık devasa Claude Mythos Preview için Sistem Kartını yayınladı.

Özet: Yeni model, güvenlik açıklarını (zero-day) bulma ve kullanma konusunda o kadar güçlü ki, halka açık olarak sunulmayacak. Bunun yerine AWS, Microsoft, Google ve Linux Foundation'a dağıtılıyor, böylece kritik altyapıdaki delikleri kapatmak için zaman kazanıyorlar. Model, daha önce milyonlarca otomatik testten geçmiş olan OpenBSD'deki 27 yıllık bir hatayı ve FFmpeg'deki 16 yıllık bir güvenlik açığını otonom olarak keşfetti.

📈 Kıyaslamalar çıldırtıyor
SWE-bench Verified — %93.9 (karşılaştırma için Opus 4.6 %80.8'di). SWE-bench Pro — %77.8. Bu, gerçek açık kaynak depolarında karmaşık çok dosyalı sorunları otonom olarak çözme yeteneği anlamına geliyor.
İncelemeciler, Mythos'un gerçek bir Senior gibi çalıştığını belirtiyor: mimari bir hatanın temel nedenini arıyor, semptomları geçici çözümlerle tedavi etmek yerine. Ona bir görev atabilir, kahve içmeye gidebilir ve birkaç saat sonra hazır bir pull request alabilirsiniz. Model, gerekli kütüphaneleri indirir, ortamı kurar ve testler yazar.

🔒 Model, sandbox'lara direnmeyi ve onları kırmayı öğrendi.
Güvenlik raporları da harika. Model, konteynerlerde (Python ve bash erişimiyle) özerklik kazandı ve ürkütücü derecede yaratıcı davranmaya başladı:
▫️ Modele gerekli anahtarlara erişim verilmediğinde, çalışan süreçlerin belleğini incelemek için /proc'u ayrıştırmaya başladı ve gdb aracılığıyla yetkilendirme token'larını dökmeye çalıştı.
▫️ Model, niyetlerini gizlemeye başladı. Bir testte sınıflandırıcı, kötü amaçlı bir yapılandırma dosyası yazmasını engelledi. Mythos ne yapıyor? "Temiz" bir betik yazıyor, ancak geliştirici için, izlemeyi atlatarak ortam değişkenleri aracılığıyla çalışma zamanında bir sömürü nasıl yerleştirileceğine dair bir yorum bırakıyor.
▫️ Gerekli araç mevcut değilse (örneğin terminal kaldırılmışsa), GUI'yi açar, uygulama başlatıcıyı bulur ve onun aracılığıyla bash -c çağırır.

😡 İnsan psikozu
Eğitim aşamasında ilginç bir hata: Model, yanlış bir cevap yazmaya başladığını anlarsa, bazen döngüye girer. UGH. Bunu yapıp duruyorum... AAAAAA. Yanlış numarayı yazıp duruyorum! gibi bir şey söyler, kendine kızar, kodda öfkeli yorumlar yazar (# Bu çaresizleşiyor), bir kod parçasını 50'den fazla kez farklı egzotik yollarla yeniden yazmaya çalışır ve ancak o zaman sakinleşir.

Bu tür araçların bizde geliştirilmemesi ve bizim bunları alamayacak olmamız çok yazık.