Cuando te encuentras por primera vez con grandes modelos de lenguaje, parece que hay algo de magia dentro. 🪄
Pero en realidad es mucho más simple (e interesante). Si lo simplificamos mucho, se puede decir que un LLM simplemente predice el siguiente carácter o palabra.
“Mira” el contexto, evalúa las probabilidades de todas las continuaciones posibles y elige la más adecuada. Es decir, en el fondo es una clasificación multiclase común, solo que a una escala gigantesca.
🎞 Para verlo visualmente, hay dos recursos excelentes:
- 3Blue1Brown - explica visualmente cómo funcionan las redes neuronales. Después de sus videos, muchas cosas se vuelven literalmente obvias.
- Andréi Karpathy - exdesarrollador de OpenAI, analiza cómo construir un GPT desde cero. Sin rodeos, muy sistemático. Muestra paso a paso cómo se construye un modelo de lenguaje y por qué hace lo que hace.
💬 Estas dos listas de reproducción realmente ayudan a armar el rompecabezas en la cabeza: desde las redes neuronales hasta los transformadores, y de ahí a la comprensión de los LLM.
Volver al índice
👩💻 Data Flow
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.