Karpathy lançou um pesquisador autônomo de IA que ajusta redes neurais enquanto você dorme 🤯

Andrej Karpathy lançou o autoresearch — um repositório que literalmente transforma o processo de pesquisa em ML em um loop while True para agentes LLM.

A mecânica é simples e construída em torno de três arquivos:
1️⃣ prepare.py — a base sólida. Baixa dados, treina um tokenizador BPE e define uma função de avaliação (métrica val_bpb — bits per byte). Este arquivo é proibido para o agente tocar. Isso isola a métrica do experimento, para que a IA não "hackeie" o próprio teste.
2️⃣ train.py — o sandbox. Treinamento de um modelo tipo GPT com um otimizador personalizado moderno (aqui usa Muon + AdamW). Este arquivo o agente pode modificar como quiser: alterar camadas, hiperparâmetros, tamanho do lote, lógica.
3️⃣ program.md — instrução/prompt que define as regras do jogo para o agente (por exemplo, Claude local).

⚙️ Como funciona o loop:
Você dá a tarefa à IA e vai dormir. O agente lê o código, cria uma hipótese (por exemplo, "vou alterar a taxa de aprendizado e ajustar os value embeddings"), reescreve o train.py e inicia o treinamento.

O agente tem um limite rígido — exatamente 300 segundos por execução. O agente cria uma hipótese ➡️ reescreve o train.py ➡️ executa o script.
Se após 5 minutos o val_bpb cair, a alteração é fixada (git commit). Se ocorrer OOM ou a métrica degradar — git reset e próxima hipótese.

Um experimento — 5 minutos. Isso dá 12 experimentos por hora. Cerca de 100 enquanto você dorme. De manhã, você simplesmente abre o results.tsv (há um script no repositório para plotar gráficos) e pega a arquitetura pronta otimizada para seu hardware.

Você não precisa mais depurar dimensões de tensores manualmente. Seu valor como engenheiro agora é medido não pelo conhecimento dos parâmetros do PyTorch, mas pela sua habilidade em escrever um bom program.md 😏

#opensource_legal