Quand on rencontre pour la première fois les grands modèles de langage, on a l'impression qu'il y a de la magie à l'intérieur. 🪄
Mais en réalité, c'est bien plus simple (et intéressant). Si on simplifie beaucoup, on peut dire que le LLM prédit simplement le prochain symbole ou mot.
Il "regarde" le contexte, évalue les probabilités de toutes les suites possibles et choisit la plus appropriée. En gros, c'est une classification multi-classes ordinaire, mais à une échelle gigantesque.
🎞 Pour le voir visuellement, il y a deux superbes ressources :
- 3Blue1Brown - explique visuellement comment fonctionnent les réseaux de neurones. Après ses vidéos, beaucoup de choses deviennent littéralement évidentes.
- Andrej Karpathy - ancien développeur d'OpenAI, explique comment construire un GPT à partir de zéro. Sans blabla, très systématique. Il montre étape par étape comment se construit un modèle de langage et pourquoi il fait ce qu'il fait.
💬 Ces deux playlists aident vraiment à assembler le puzzle dans la tête : des réseaux de neurones aux transformeurs, et de là à la compréhension des LLM.
Retour à la table des matières
👩💻 Data Flow
Commentaires
0Aucun commentaire pour le moment.
Connectez-vous pour participer à la discussion.