Karpathy lanzó un investigador autónomo de IA que ajusta redes neuronales mientras duermes 🤯

Andrej Karpathy publicó autoresearch — un repositorio que literalmente convierte el proceso de investigación en ML en un bucle while True para agentes LLM.

La mecánica es simple y se basa en tres archivos:
1️⃣ prepare.py — base sólida. Descarga datos, entrena un tokenizador BPE y define una función de evaluación (métrica val_bpb — bits por byte). Este archivo está prohibido para el agente. Es el aislamiento de la métrica del sujeto de prueba, para que la IA no "hackee" la prueba en sí.
2️⃣ train.py — caja de arena. Entrenamiento de un modelo similar a GPT con un optimizador personalizado moderno (aquí se usa Muon + AdamW). Este archivo el agente lo modifica como quiera: cambia capas, hiperparámetros, tamaño de lote, lógica.
3️⃣ program.md — instrucción-prompt que establece las reglas del juego para el agente (por ejemplo, Claude local).

⚙️ Cómo se ve el bucle:
Le das a la IA una tarea y te vas a dormir. El agente lee el código, idea una hipótesis (por ejemplo, "cambiaré la tasa de aprendizaje y ajustaré los embeddings de valor"), reescribe train.py y ejecuta el entrenamiento.

El agente tiene un límite estricto: exactamente 300 segundos por ejecución. El agente idea una hipótesis ➡️ reescribe train.py ➡️ ejecuta el script.
Si después de 5 minutos val_bpb ha bajado, el cambio se guarda (git commit). Si se produce un OOM o la métrica degrada — git reset y siguiente hipótesis.

Un experimento — 5 minutos. Son 12 experimentos por hora. Alrededor de 100 mientras duermes. Por la mañana simplemente abres results.tsv (en el repo hay un script para dibujar gráficos) y te llevas la arquitectura optimizada lista para tu hardware.

Ya no necesitas depurar las dimensiones de los tensores manualmente. Tu valor como ingeniero ahora se mide no por el conocimiento de los parámetros de PyTorch, sino por lo bien que sabes escribir program.md 😏

#buen_open_source