
La realidad contraataca: por qué la alabada IA obtiene un 0% en el nuevo benchmark 🔨
Acabo de leer el ensayo de Jack Clark sobre la inminente singularidad y el SWE-Bench hecho trizas, donde aparecían cifras impresionantes: las mejores IAs obtienen un 93.9% en SWE-Bench, cerrando casi de forma autónoma issues reales de GitHub. Parecía que era hora de borrar el IDE e ir a aprender a ser barista.
Pero los chicos de Stanford y Harvard han lanzado un nuevo benchmark — ProgramBench. Y ha humillado públicamente a todos los modelos frontier existentes.
Spoiler: el resultado de GPT-5.4, Claude Opus 4.7 y Gemini 3.1 Pro es exactamente 0%.
¿En qué consiste?
Se le da al agente un binario compilado (desde un simple jq hasta monstruos como FFmpeg o SQLite) y documentación.
La tarea es escribir desde cero una base de código que reproduzca al 100% el comportamiento del original.
Lo más gracioso es cómo los autores tuvieron que aislar el sandbox. Inicialmente, cuando el acceso a la red estaba abierto, las redes neuronales, en lugar de "escribir código", simplemente parseaban --help, encontraban el repositorio relevante en GitHub y hacían git clone. Cuando se cortó la red, los agentes intentaban descargar las fuentes a través de gestores de paquetes o simplemente escribían wrappers de bash alrededor del binario original.
Para cerrar esta payasada, los contenedores se aislaron por completo y los binarios se configuraron con permisos 111 (solo ejecución). Sin lectura. Ingeniería inversa black-box pura: introduces entradas, observas salidas, escribes la implementación en cualquier lenguaje Turing-completo.
Y entonces se descubrió algo asombroso. Una cosa es darle a la red neuronal un repositorio ya preparado con una arquitectura establecida, donde solo necesita escribir un parche de 50 líneas. Y otra muy distinta es hacer que diseñe un sistema.
En cuanto la IA se queda sin "muletas" en forma de abstracciones ya hechas, inventadas por ingenieros de carne y hueso, se derrumba. Resulta que los modelos no saben de diseño de sistemas, descomposición y construcción de interfaces. Físicamente no pueden mantener en su "cabeza" una arquitectura desde cero si no se les dan marcos rígidos. Y esto a pesar de que los modelos quemaban hasta $5000 por una sola ejecución, sin toparse con límites de contexto.
En resumen, los sacos de carne aún pueden luchar. 💪
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.