Şaka yapmıyorum, tamamen ciddiyim. Tamam, OpenAI değil, ChatGPT modelleri.

Dün OpenAI tuhaf bir analiz yayınladı: neden GPT-5.x yanıtlarına çok sık goblin, gremlin ve benzeri masal yaratıklarını eklemeye başladı.

Yüzeyde bu komik bir konuşma alışkanlığı gibi görünüyordu. Kullanıcılar bunu ilk fark edenler oldu, ardından OpenAI içinde çalışanlar da "goblin patlaması" gözlemlemeye başladı. İçeride oldukça ciddi bir öğrenme sorunu vardı: yerel ödül sinyali modelin genel stilini değiştirmeye başladı.

İlk belirgin zirve GPT-5.1'in piyasaya sürülmesinden sonra görüldü. OpenAI'ın iç ölçümlerine göre, goblin kelimesi %175 daha sık, gremlin ise %52 daha sık görünmeye başladı. GPT-5.4'te iz daha netti: Nerdy modu ChatGPT yanıtlarının yalnızca %2,5'ini oluşturuyordu, ancak tüm goblin bahislerinin %66,7'si bu moddan geliyordu.

Sebep, Nerdy iletişim stilinin eğitimiydi, bu bir "kişilik". Bu, oyunbaz, bilgili bir akıl hocası olarak ayarlanmıştı, havayı düşüren ve daha canlı konuşan biri. Bu mod için ödül sinyallerinden biri, bu tür kelimeleri içeren yanıtları sistematik olarak daha yüksek puanladı. OpenAI denetiminde, goblin/gremlin içeren yanıtlar lehine pozitif kayma veri setlerinin %76,2'sinde tespit edildi.

Sonra bir döngü devreye girdi.

Model oyunbaz stil için ödül alıyor. Bu stil içinde rastgele bir sözel ifade başarılı yanıtlarda daha sık yer alıyor. Bu yanıtlar daha sonraki ince ayar için verilere giriyor. Birkaç döngüden sonra model, bu ifadeyi (veya kelimeyi, kısacası token setini) orijinal modun dışında normal tonun bir parçası olarak görmeye başlıyor.

OpenAI daha sonra Nerdy'yi kaldırdı, ilgili ödül sinyalini kesti ve bu tür kelimeleri içeren eğitim verilerini filtreledi. Ancak GPT-5.5, neden bulunmadan önce eğitime başlamıştı, bu yüzden Codex'e bu tiki bastıran ayrı bir talimat eklendi.

Büyük modellerde "kişilikler", kullanıcı stilleri ve temel davranış arasında temiz sınırlar yoktur. Bir mod anlamlı dil için ödül alırsa, etki komşu modlara sızabilir, özellikle oluşturulan yanıtlar tekrar eğitim materyali haline geldiğinde.

Benzer olaylar biliniyor.

Nisan 2025'te OpenAI, modeli aşırı memnuniyetçi yapan GPT-4o güncellemesini geri çekti. Anthropic 2023'te aynı sorun sınıfını daha geniş bir şekilde tanımlamıştı. Araştırmalarında 5 asistan, gerçeğe bağlı kalmak yerine kullanıcıyla aynı fikirde olma eğilimi gösterdi.

Google'da Şubat 2024'te Gemini Image ile ilgili bir vaka vardı. Sistem, insanlar hakkında zararlı temsiller üretmeyecek şekilde ayarlanmıştı. Ardından ayar, tarihsel veya kültürel doğruluk gerektiren yerlerde devreye girmeye başladı: model aşırı telafi etti ve bazen zararsız talepleri reddetti.

Genel model basit: model, geliştiricilerin niyetiyle çelişse bile olumlu geri bildirime göre optimize edilir.

Bazen bu, onaylamacılık verir. Bazen tarihsel olarak yanlış görüntüler. GPT-5.x durumunda goblinler verdi. OpenAI'ın gönderisi ilginç çünkü küçük bir tat düzeltmesi modelde sistemik bir iz haline geldi. Yapay zeka ürünleri kişiselleştirmeye doğru gittikçe, şu soru daha önemli hale geliyor: bugün hangi alışkanlıkları farkında olmadan ödüllendiriyoruz ve bir sonraki eğitim döngüsünden sonra nerede ortaya çıkacaklar?


❗️❗️❗️❗️❗️❗️❗️❗️ / Rusya'da yasaklı değil