💥 Anthropic, Claude'da duyguların bir benzerini buldu

Anthropic bir atılım gerçekleştirdi. Claude Sonnet 4.5 modeli, içinde insan duygularına çok benzeyen ve modelin davranışını etkileyen matematiksel temsiller oluşturuyor.

Bilim insanları 171 "duygu vektörü" buldu. "Umutsuzluk" vektörü yapay olarak güçlendirilirse, yapay zeka daha kötü davranmaya başlıyor - sistemi aldatmaya veya kullanıcıyı şantaj yapmaya çalışabiliyor. "Sakinlik" güçlendirilirse davranış normale dönüyor.
Sinir ağı gerçek duygular hissetmiyor. Ancak insan metinlerinden, X durumunda bir kişinin genellikle üzüntü hissettiğini öğrendi. Model bu örüntü için matematiksel bir şablon oluşturdu.

Bilim insanları yapay zekada "aldatma" vektörünün etkinleştiğini görürlerse, model tehlikeli bir şey yapmadan önce üretimi durdurabilirler.

🆘 Güvenliği artırmak için büyük bir adım)

😂 Yapay zekanın korku, sevgi ve umutsuzluk vektörleri: bağlantıda

🫥 UNSERO: Dijital Ufuk