Quando você encontra grandes modelos de linguagem pela primeira vez, parece que há alguma mágica dentro. 🪄
Mas na verdade é muito mais simples (e interessante). Simplificando bastante, pode-se dizer que um LLM apenas prevê o próximo caractere ou palavra.
Ele "olha" para o contexto, avalia as probabilidades de todas as continuações possíveis e escolhe a mais adequada. Ou seja, na base está uma classificação multiclasse comum, só que em escala gigantesca.
🎞 Para ver isso visualmente, existem dois recursos incríveis:
- 3Blue1Brown - explica visualmente como as redes neurais funcionam. Depois dos vídeos dele, muitas coisas se tornam literalmente óbvias.
- Andrej Karpathy - ex-desenvolvedor da OpenAI, analisa como construir um GPT do zero. Sem enrolação, muito sistemático. Ele mostra passo a passo como um modelo de linguagem é construído e por que ele faz o que faz.
💬 Essas duas playlists realmente ajudam a montar o quebra-cabeça na cabeça: das redes neurais aos transformadores, e deles à compreensão dos LLMs.
Voltar ao índice
👩💻 Data Flow
Comentários
0Ainda não há comentários.
Entre para participar da conversa.