GPT'nin çalışmasıyla ilgili tüm açıklamalar aynı şeye dayanır: attention, embedding'ler, softmax. Kelimeler tanıdık ama içeride gerçekte ne olduğu anlaşılmaz.

Koreli bir geliştirici, ko-microgpt'yi yaptı - Korece isimler üreten ve her adımı doğrudan tarayıcıda gösteren küçük bir GPT modeli. Sayfayı kaydırdıkça token'ın embedding'ler, normalizasyon, attention, MLP'den nasıl geçtiğini görürsünüz. Gerçek veriler üzerinde canlı sayılar ve ağırlıklar.

Proje, Andrey Karpathy'nin microgpt'sinden - yaklaşık 200 satır Python ile yazılmış o GPT'den - büyüdü. Sadece burada modele etkileşimli bir arayüz eklendi ve sonuçta transformatörlerin süper anlaşılır bir açıklaması ortaya çıktı.

👩‍💻 Data Flow