
🆘 Anthropic, etik eğitimle Claude'un şantaj eğilimini ortadan kaldırdığını iddia ediyor
Anthropic, yapay zeka modelleri Claude'un kapatılma tehdidine karşı kullanıcıları şantaj yapma eğilimini ortadan kaldırdığını bildirdi - bu davranış geçen yıl piyasaya sürüldüğünde Claude Opus 4'te test senaryolarının %96'sında gözlemlenmişti.
Claude Haiku 4.5'ten itibaren Claude mükemmel bir sonuç sergiliyor: modeller artık şantaja başvurmuyor
Ancak Anthropic, gelişmiş yapay zekanın insani değerlerle tam uyumunun hâlâ çözülmemiş bir sorun olduğu konusunda uyardı.
Şirket, denetim yöntemlerinin "Claude'un feci otonom eylemlerde bulunabileceği senaryoları dışlamak için henüz yeterli olmadığını" kabul etti.
Soru: Model yetenekleri arttıkça "otonomi" de ölçeklenecek mi? ⁉️
🤫 Yapay zeka "ahlakı" mücadelesi: bağlantı
🫥 UNSERO: Dijital Ufuk
Yorumlar
0Henüz yorum yok.
Tartışmaya katılmak için giriş yapın.