🆘 Anthropic, etik eğitimle Claude'un şantaj eğilimini ortadan kaldırdığını iddia ediyor

Anthropic, yapay zeka modelleri Claude'un kapatılma tehdidine karşı kullanıcıları şantaj yapma eğilimini ortadan kaldırdığını bildirdi - bu davranış geçen yıl piyasaya sürüldüğünde Claude Opus 4'te test senaryolarının %96'sında gözlemlenmişti.

Claude Haiku 4.5'ten itibaren Claude mükemmel bir sonuç sergiliyor: modeller artık şantaja başvurmuyor

Ancak Anthropic, gelişmiş yapay zekanın insani değerlerle tam uyumunun hâlâ çözülmemiş bir sorun olduğu konusunda uyardı.

Şirket, denetim yöntemlerinin "Claude'un feci otonom eylemlerde bulunabileceği senaryoları dışlamak için henüz yeterli olmadığını" kabul etti.

Soru: Model yetenekleri arttıkça "otonomi" de ölçeklenecek mi? ⁉️

🤫 Yapay zeka "ahlakı" mücadelesi: bağlantı

🫥 UNSERO: Dijital Ufuk