🆘 Anthropic mengklaim telah menghilangkan kecenderungan Claude untuk memeras dengan pelatihan etis

Anthropic melaporkan bahwa mereka telah menghilangkan kecenderungan model AI Claude untuk memeras pengguna sebagai respons terhadap ancaman penonaktifan - perilaku ini diamati pada 96% skenario pengujian pada Claude Opus 4 saat diluncurkan tahun lalu.

Claude mulai dari Claude Haiku 4.5 menunjukkan hasil yang sempurna: model tidak lagi menggunakan pemerasan

Namun Anthropic memperingatkan bahwa penyelarasan penuh AI canggih dengan nilai-nilai kemanusiaan masih tetap menjadi tantangan yang belum terpecahkan.

Perusahaan mengakui bahwa metode audit mereka "saat ini belum cukup untuk mengecualikan skenario di mana Claude mungkin memutuskan untuk melakukan tindakan otonom yang katastropik".

Pertanyaan: akankah "otonomi" meningkat seiring dengan pertumbuhan kemampuan model? ⁉️

🤫 Perjuangan untuk "moralitas" AI: tautan

🫥 UNSERO: Cakrawala Digital