🤯 Como LLMs funcionam por baixo dos panos #MLSTART

Quando você encontra grandes modelos de linguagem pela primeira vez, parece que há alguma mágica dentro. 🪄

Mas na verdade é muito mais simples (e interessante). Simplificando bastante, pode-se dizer que um LLM apenas prevê o próximo caractere ou palavra.

Ele "olha" para o contexto, avalia as probabilidades de todas as continuações possíveis e escolhe a mais adequada. Ou seja, na base está uma classificação multiclasse comum, só que em escala gigantesca.

🎞 Para ver isso visualmente, existem dois recursos incríveis:

- 3Blue1Brown - explica visualmente como as redes neurais funcionam. Depois dos vídeos dele, muitas coisas se tornam literalmente óbvias.

- Andrej Karpathy - ex-desenvolvedor da OpenAI, analisa como construir um GPT do zero. Sem enrolação, muito sistemático. Ele mostra passo a passo como um modelo de linguagem é construído e por que ele faz o que faz.

💬 Essas duas playlists realmente ajudam a montar o quebra-cabeça na cabeça: das redes neurais aos transformadores, e deles à compreensão dos LLMs.

Voltar ao índice

👩‍💻 Data Flow