Salió el informe anual de Stanford sobre IA. No es necesario leer 400 páginas, aquí están los datos más importantes 👇

💻 Muchos benchmarks de programación han sido superados
La métrica SWE-bench Verified, que evalúa la capacidad de resolver issues reales en GitHub, saltó del 60% a casi el 100% en solo un año. Las pruebas diseñadas para años se saturan en meses. En Terminal-Bench (trabajo del agente en una consola real: desde compilación hasta levantar servidores) la precisión aumentó del 20% al 77.3%.

🗑 Internet está muerto, la síntesis no salva
Desde enero de 2025, >50% del nuevo contenido en internet es generado por IA. Sin embargo, entrenar LLM puramente con datos sintéticos aún no funciona: la calidad no mejora. Toda la magia ahora está en el enfoque centrado en datos. El modelo OLMo 3.1 Think 32B muestra resultados a la par de Grok 4 con 90 veces menos parámetros. El secreto: poda estricta, deduplicación y curación del conjunto de entrenamiento, no un aumento sin sentido de pesos.

⚔️ Fin del monopolio estadounidense y era de opacidad
La brecha tecnológica entre EE. UU. y China prácticamente ha desaparecido. Los modelos chinos están casi a la par con los buques insignia estadounidenses. La diferencia entre los 4 mejores modelos es microscópica.
Además, la industria se ha vuelto absolutamente opaca. Para los sistemas más potentes ya no se revelan ni la arquitectura, ni los scripts de entrenamiento, ni los tamaños de los conjuntos de datos.

🤡 Frontera dentada (Jagged Frontier)
Las redes neuronales ganan oro en la Olimpiada Internacional de Matemáticas (Gemini Deep Think obtuvo 35 puntos), pero no pueden decir la hora en un reloj analógico (fallan en el 49.9% de los casos, error medio de una a tres horas). En OSWorld (gestión de aplicaciones de escritorio) los agentes fallan una de cada tres tareas. La capacidad de resolver matemáticas complejas no implica sentido común.

📉 El mercado para juniors se colapsa
El aumento comprobado de productividad de los desarrolladores (+26% de pull requests cerrados usando IA) afecta a los puestos iniciales. El número de programadores empleados de 22 a 25 años en EE. UU. se desplomó casi un 20% en comparación con 2024. Los investigadores llaman a esto "cambio tecnológico sesgado por seniority": la IA reemplaza el trabajo junior, mientras que la contratación de desarrolladores senior sigue creciendo.

🔌 Fragilidad de infraestructura
La capacidad computacional global para IA crece 3.3 veces cada año (alcanzó 17.1 millones de equivalentes H100). EE. UU. alberga más de 5,400 centros de datos (10 veces más que cualquier otro país), pero casi todos los chips de IA avanzados del mundo se producen en una sola fábrica de TSMC en Taiwán. El consumo energético de los centros de datos de IA alcanzó los 29.6 GW, comparable al consumo máximo de todo el estado de Nueva York.
La inferencia también consume recursos: el consumo anual de agua solo para generar GPT-4o equivale a las necesidades de agua potable de 1.2 millones de personas.