IT işe alımında "bizden-bizden olmayan" etkisi: özgeçmişi elle yazmak neden istatistiksel olarak dezavantajlı 🤖

Yeni bir araştırma, modern işe alım süreçlerinde sistematik bir hatayı matematiksel olarak kanıtladı.

Piyasada, adayların özgeçmişlerini yapay zeka ile oluşturduğu, şirketlerin ise aynı LLM'leri ilk eleme için kullandığı bir durum oluştu. Araştırmacılar, bu iki süreç çakıştığında ne olduğunu ölçtü.

2245 gerçek insan özgeçmişini aldılar, bunlara dayanarak farklı LLM'ler aracılığıyla kopyalar oluşturdular (sert beceriler ve deneyim birebir aynı kaldı, sadece ifadeler ve sunum değişti) ve bunları LLM değerlendiricilere verdiler.

Sonuçlar şöyle:

1️⃣ Kendini tercih etme yanlılığı (Self-preference bias). Modeller, kendini tanıma mekanizmasına sahip ve sistematik olarak kendilerinin yazdığı metinleri seçiyor. GPT-4o, DeepSeek-V3 ve LLaMA-3.3-70B için insan yazımı metinlere karşı yanlılık oranı %67 ile %82 arasında değişiyor.

2️⃣ Kısa listeye kalma oranı. Özgeçmişi, şirketin eleme için kullandığı LLM tarafından düzenlenen bir adayın, tamamen aynı geçmişe sahip olmasına rağmen mülakata davet edilme şansı %23-60 daha fazla.

3️⃣ Kaliteye körlük. Kör testlerde insan değerlendiriciler, orijinal insan özgeçmişlerini daha anlaşılır ve mantıklı buldu. Ancak LLM eleyiciler, sırf kendi dilsel kalıplarını tanıdıkları için yine de üretilmiş versiyonları seçti.

Aday ve şirket farklı araçlar kullanıyorsa, modeller arasındaki çatışmalara dair ayrı istatistikler var:
▫️ DeepSeek-V3 en yüksek "narsisizm" seviyesine sahip: metinlerini LLaMA-3.3-70B metinlerine karşı %69, GPT-4o'ya karşı %28 daha sık seçiyor.
▫️ GPT-4o ise ikili karşılaştırmalarda beklenmedik bir şekilde DeepSeek tarafından yazılan özgeçmişleri tercih ederek kendi üretimlerini geri plana atıyor.

Kısacası, tamamen "el yapımı" bir özgeçmiş göndererek, metni bir prompt'tan geçirenlere kıyasla eleme aşamasında teknik olarak %60'a kadar avantaj kaybediyorsunuz. Özgeçmiş stilini belirli bir şirketin LLM sürecine uydurabilme becerisi, artık mülakat öncesi dönüşüm oranını gerçek ticari deneyimden daha fazla etkiliyor.

Ne kadar da bozuk bir sistem ☹️