Saat pertama kali berhadapan dengan model bahasa besar, sepertinya ada semacam sihir di dalamnya. 🪄
Tapi sebenarnya semuanya jauh lebih sederhana (dan lebih menarik). Jika disederhanakan, bisa dikatakan bahwa LLM hanya memprediksi karakter atau kata berikutnya.
Ia "melihat" konteks, mengevaluasi probabilitas semua kemungkinan kelanjutan, dan memilih yang paling sesuai. Jadi, dasarnya adalah klasifikasi multikelas biasa, hanya dalam skala raksasa.
🎞 Untuk melihatnya secara visual, ada dua sumber daya luar biasa:
- 3Blue1Brown - menjelaskan secara visual cara kerja jaringan saraf. Setelah videonya, banyak hal menjadi jelas.
- Andrej Karpathy - mantan pengembang OpenAI, menguraikan cara membuat GPT dari awal. Tanpa basa-basi, sangat sistematis. Ia menunjukkan langkah demi langkah bagaimana model bahasa dibangun dan mengapa ia melakukan apa yang dilakukannya.
💬 Kedua playlist ini benar-benar membantu menyusun teka-teki di kepala: dari jaringan saraf ke transformer, dan dari sana ke pemahaman LLM.
Kembali ke daftar isi
👩💻 Data Flow
Comments
0No comments yet.
Sign in to join the discussion.