Singularidad en el horizonte: código que escribe código que entrena código 🔮

Jack Clark (cofundador de Anthropic) publicó un ensayo-análisis sobre el estado actual de la industria de la IA.

Su tesis principal: con una probabilidad >60% antes de finales de 2028 veremos un ciclo de I+D completamente automatizado. Es decir, el modelo más avanzado podrá entrenar de forma autónoma su siguiente versión, más inteligente, sin participación de sacos de carne.

Suena como el inicio de una ciencia ficción barata, pero Clark lo explica todo con métricas. Si observamos los datos agregados de los benchmarks, resulta un poco inquietante lo rápido que se reduce el horizonte de la competencia humana.

1️⃣ Saturación de los benchmarks de ingeniería
SWE-Bench (resolución de issues reales de GitHub). A finales de 2023, el mejor resultado era un miserable 2% con Claude 2. Ahora Claude Mythos Preview alcanza un 93.9%. De hecho, el benchmark está superado.
El marco temporal de autonomía (METR) ha pasado de 4 minutos con GPT-4 en 2023 a 12 horas de trabajo continuo con Opus 4.6 hoy. Esto es una jornada laboral completa de un desarrollador junior que no se toma descansos. Para finales de 2026 se espera un salto a 100 horas. Esto es suficiente para que la red neuronal no solo corrija un error, sino que reescriba la arquitectura del servicio mientras tú haces otra cosa.

2️⃣ Automatización de la rutina de los científicos de datos
Benchmark MLE-Bench (competiciones offline de Kaggle). El mejor sistema basado en Gemini3 alcanza un 64.4%.
CORE-Bench (reproducción de artículos científicos de ML a partir del repositorio). El modelo mismo instala dependencias, configura el entorno, ejecuta el código y verifica los resultados. Puntuación: 95.5%.

3️⃣ Lo más importante: la IA se adentra en la optimización de alto nivel
Las redes neuronales han aprendido a escribir y optimizar kernels de GPU (Triton/CUDA). Anthropic mide cómo los modelos optimizan el código para entrenar LLM en CPU. En un año, la aceleración ha pasado de 2.9x (Opus 4) a 52x (Claude Mythos Preview). Un humano necesitaría una jornada laboral completa para lograr ese resultado.
Ha aparecido PostTrainBench, donde modelos grandes ajustan pesos pequeños de código abierto. Actualmente, los agentes de IA ya rinden aproximadamente un 50% del rendimiento de ingenieros de ML de primer nivel en laboratorios punteros.

Sí, a los modelos aún les falta "creatividad" para crear nuevos paradigmas (como los transformers), pero no la necesitan. La escalabilidad extensiva mediante equipos autónomos de agentes de IA será más que suficiente.

Es muy posible que las grandes empresas sean "grandes" en capital (necesitan muchas GPU), pero muy pequeñas en personal. ¿Para qué mantener una plantilla de 50 ingenieros si un solo arquitecto puede gestionar un enjambre de 500 agentes sintéticos que no se agotan y escriben código a la velocidad de la luz? Bueno, esto es si todo va según el escenario ideal y no hay cisnes negros.

¿Creemos?