Büyük dil modelleriyle ilk karşılaştığınızda, içinde bir tür sihir varmış gibi gelir. 🪄
Ama aslında her şey çok daha basit (ve ilginç). Çok basitleştirirsek, LLM'nin sadece bir sonraki karakteri veya kelimeyi tahmin ettiğini söyleyebiliriz.
Bağlama "bakar", tüm olası devamların olasılıklarını değerlendirir ve en uygun olanı seçer. Yani temelinde, devasa ölçekte sıradan bir çok sınıflı sınıflandırma vardır.
🎞 Bunu görsel olarak görmek için iki harika kaynak var:
- 3Blue1Brown - sinir ağlarının nasıl çalıştığını görsel olarak açıklıyor. Onun videolarından sonra birçok şey kelimenin tam anlamıyla aşikar hale geliyor.
- Andrej Karpathy - eski OpenAI geliştiricisi, sıfırdan bir GPT'nin nasıl oluşturulacağını anlatıyor. Gereksiz ayrıntılar olmadan, çok sistematik. Dil modelinin nasıl inşa edildiğini ve neden yaptığını yaptığını adım adım gösteriyor.
💬 Bu iki oynatma listesi, kafanızdaki yapbozu gerçekten tamamlamaya yardımcı oluyor: sinir ağlarından transformatörlere ve onlardan LLM'leri anlamaya.
İçindekilere dön
👩💻 Data Flow
Yorumlar
0Henüz yorum yok.
Tartışmaya katılmak için giriş yapın.