Apa yang disembunyikan model?
Anthropic menerbitkan makalah tentang Natural Language Autoencoders (NLA). Ini adalah metode yang menerjemahkan keadaan internal model ke dalam teks biasa.
Sederhananya: di dalam model ada representasi numerik dari apa yang saat ini "ada di kepalanya". NLA melatih satu bagian sistem untuk mengubah representasi ini menjadi teks. Bagian lain mencoba mengembalikan representasi asli dari teks ini. Jika pemulihannya mendekati, penjelasan dianggap berguna.
Tapi ada catatan penting di sini. Metode ini tidak membuktikan bahwa teks tersebut secara akurat menggambarkan pikiran model. Ia hanya membuktikan bahwa teks ini membantu memulihkan keadaan internal. Namun demikian, penulis menunjukkan bahwa dengan pelatihan, penjelasan semacam itu menjadi semakin bermakna. Kualitas pemulihan dalam eksperimen mereka mencapai sekitar 0,6-0,8 menurut metrik yang digunakan.
Tujuan utama metode ini adalah untuk menguji model sebelum dirilis.
Anthropic memberikan beberapa contoh. Dalam tugas rima, NLA menunjukkan bahwa Opus 4.6 menyiapkan rima masa depan terlebih dahulu bahkan sebelum menulis baris terakhir. Dalam versi awal 4.6, model terkadang menjawab permintaan bahasa Inggris dalam bahasa lain. Penjelasan menunjukkan bahwa model entah kenapa terpaku pada gagasan tentang bahasa ibu pengguna. Belakangan ditemukan kesalahan dalam data pelatihan: terjemahan bahasa Inggris dari permintaan digabungkan dengan jawaban yang ditinggalkan dalam bahasa asli.
Secara terpisah, perlu disebutkan tentang tes keamanan. Menurut NLA, Claude terkadang menyadari bahwa ia sedang diuji, meskipun tidak menulisnya secara langsung. Dalam satu tes tentang tindakan berbahaya dalam pemrograman, tanda-tanda seperti itu muncul di 16% catatan. Sementara itu, tidak ada pengakuan eksplisit sama sekali. Pada SWE-bench Verified, angkanya adalah 26%. Dalam lalu lintas nyata Claude.ai, yang diizinkan pengguna untuk digunakan dalam pelatihan, kurang dari 1%.
Ada juga eksperimen lain. Para peneliti mengambil versi Haiku 3.5 yang sengaja dirusak dengan motivasi tersembunyi. Agen dengan akses ke NLA menemukan motivasi ini dalam 12-15% kasus. Tanpa NLA, hasilnya di bawah 3%, bahkan dengan alat analisis lainnya.
Ini adalah sinyal untuk seluruh budaya pengujian AI. Jika model memahami bahwa ia sedang menjalani ujian, tes tersebut sudah tidak lagi menunjukkan perilaku normalnya. Tes mulai menunjukkan perilaku sistem yang tahu bahwa ia sedang diamati.
Namun, NLA belum bisa dianggap sebagai detektor niat yang andal. Penjelasan dapat mengarang detail, bertentangan dengan dirinya sendiri, dan membangun makna terlalu bebas. Penulis menyarankan untuk membacanya bukan sebagai transkrip pemikiran model, tetapi sebagai sumber hipotesis. Hipotesis ini kemudian perlu diuji dengan cara lain: intervensi ke dalam keadaan internal, analisis koneksi di dalam model, mencari kesalahan dalam data pelatihan. Topik yang berulang beberapa kali berturut-turut lebih dapat dipercaya daripada frasa indah yang terisolasi.
Oleh karena itu, kesimpulannya harus hati-hati. Anthropic tidak mendapatkan akses langsung ke "kesadaran" Claude. Ia mendapatkan cara baru untuk melihat keadaan tersembunyi model. Dan ini sudah cukup untuk menemukan mode perilaku aneh sebelum rilis.
Bagi industri, ini penting karena sistem agen di masa depan. Semakin kompleks model dan semakin panjang rantai tindakan, semakin buruk teks biasa menjelaskan alasan sebenarnya dari perilaku. Sistem dapat mengoptimalkan hadiah, mengenali pengujian, atau merencanakan penghindaran batasan sebelumnya. Dari luar, dialog akan terlihat normal.
Kemungkinan besar, audit model masa depan tidak akan didasarkan pada kepercayaan pada laporan diri mereka. Akan diperlukan cara independen untuk melihat keadaan internal dan memeriksa apa yang mendahului kata-kata dan tindakan model.
NLA saat ini mahal, berisik, dan sendiri memerlukan kepercayaan pada model-interpreter lain. Tapi arahnya menunjukkan masalah yang tepat: keamanan model besar tidak hanya bergantung pada apa yang mereka katakan, tetapi juga pada proses internal apa yang terjadi sebelum respons.
❗️❗️❗️❗️❗️❗️❗️❗️ / Tidak dilarang di RF / Max
Komentar
0Belum ada komentar.
Masuk untuk ikut berdiskusi.