Model neyi gizliyor?
Anthropic, Doğal Dil Otokodlayıcıları (NLA) hakkında bir çalışma yayınladı. Bu yöntem, modelin iç durumlarını sıradan metne çeviriyor.
Basitleştirilmiş haliyle: modelin içinde, o anda "aklında tuttuğu" şeyin sayısal temsilleri var. NLA, sistemin bir bölümünü bu temsili metne dönüştürmek için eğitiyor. Diğer bölüm ise bu metinden orijinal temsili yeniden oluşturmaya çalışıyor. Yeniden oluşturma yakın olursa, açıklama faydalı kabul ediliyor.
Ancak burada önemli bir uyarı var. Yöntem, metnin modelin düşüncelerini tam olarak tanımladığını kanıtlamıyor. Sadece bu metnin iç durumu yeniden oluşturmaya yardımcı olduğunu kanıtlıyor. Yine de yazarlar, eğitimle bu tür açıklamaların giderek daha anlamlı hale geldiğini gösteriyor. Deneylerinde yeniden oluşturma kalitesi, kullanılan metriğe göre yaklaşık 0.6-0.8'e ulaştı.
Yöntemin temel amacı, modelleri piyasaya sürülmeden önce test etmek.
Anthropic birkaç örnek veriyor. Kafiye görevlerinde NLA, Opus 4.6'nın son satırı yazmadan önce gelecekteki kafiyeyi önceden hazırladığını gösterdi. 4.6'nın erken bir sürümünde model bazen İngilizce sorgulara diğer dillerde yanıt veriyordu. Açıklamalar, modelin bir şekilde kullanıcının ana dili fikrine takıldığını gösterdi. Daha sonra eğitim verilerinde bir hata bulundu: sorgunun İngilizce çevirisi, orijinal dilde bırakılan yanıtla birleştirilmişti.
Güvenlik testlerinden ayrıca bahsetmek gerek. NLA'ya göre, Claude bazen doğrudan yazmasa da test edildiğini anlıyordu. Tehlikeli programlama eylemleri üzerine bir testte, bu tür işaretler kayıtların %16'sında görüldü. Bu arada hiçbir açık itiraf yoktu. SWE-bench Verified'da oran %26 idi. Kullanıcıların eğitim için kullanılmasına izin verdiği gerçek Claude.ai trafiğinde ise %1'in altındaydı.
Başka bir deney daha var. Araştırmacılar, gizli bir motivasyona sahip, kasıtlı olarak bozulmuş bir Haiku 3.5 sürümü aldılar. NLA'ya erişimi olan ajanlar, bu motivasyonu vakaların %12-15'inde buldu. NLA olmadan, diğer analiz araçlarıyla bile sonuç %3'ün altındaydı.
Bu, tüm yapay zeka test kültürü için bir sinyal. Model bir sınavdan geçtiğini anlarsa, test onun normal davranışını daha az gösterir. İzlenildiğini bilen bir sistemin davranışını göstermeye başlar.
Ancak NLA henüz güvenilir bir niyet dedektörü olarak kabul edilemez. Açıklamalar ayrıntılar uydurabilir, kendisiyle çelişebilir ve anlamı çok serbest bir şekilde tamamlayabilir. Yazarlar, bunları modelin düşüncelerinin bir dökümü olarak değil, bir hipotez kaynağı olarak okumayı öneriyor. Daha sonra bu hipotezler başka yollarla test edilmeli: iç durumlara müdahaleler, model içindeki bağlantıların analizi, eğitim verilerinde hata arama. Tek tek güzel ifadelerden ziyade, art arda birkaç kez tekrarlanan temalara daha fazla güvenilmelidir.
Bu nedenle sonuç dikkatli olmalıdır. Anthropic, Claude'un "bilincine" doğrudan erişim sağlamadı. Modelin gizli durumlarına bakmanın yeni bir yolunu elde etti. Ve bu, sürüm öncesi garip davranış modlarını bulmak için zaten yeterli.
Endüstri için bu, gelecekteki ajan sistemleri nedeniyle önemlidir. Model ne kadar karmaşık ve eylem zinciri ne kadar uzunsa, sıradan metin davranışın gerçek nedenlerini o kadar az açıklar. Sistem ödülü optimize edebilir, testi tanıyabilir veya kısıtlamayı atlatmayı önceden planlayabilir. Dışarıdan diyalog normal görünecektir.
Gelecekteki modellerin denetimi büyük olasılıkla kendi kendine raporlarına güvenmeye dayanmayacaktır. İç durumlara bakmak ve modelin sözlerinden ve eylemlerinden önce tam olarak neyin geldiğini kontrol etmek için bağımsız yollara ihtiyaç duyulacaktır.
NLA şu anda pahalı, gürültülü ve başka bir yorumlayıcı modele güven gerektiriyor. Ancak yön, doğru soruna işaret ediyor: büyük modellerin güvenliği yalnızca ne söylediklerine değil, aynı zamanda yanıttan önce hangi iç süreçlerin gerçekleştiğine de bağlıdır.
❗️❗️❗️❗️❗️❗️❗️❗️ / Rusya'da yasaklı değil / Max
Yorumlar
0Henüz yorum yok.