Anthropic lanzó el anuncio del Project Glasswing y una monstruosa System Card para Claude Mythos Preview de 244 páginas.
El punto: el nuevo modelo resultó ser tan poderoso en encontrar y explotar vulnerabilidades (zero-days) que no lo lanzarán al acceso público. En su lugar, lo están distribuyendo a AWS, Microsoft, Google y Linux Foundation para que puedan parchear los agujeros en la infraestructura crítica. El modelo ya descubrió de forma autónoma un bug de 27 años en OpenBSD y una vulnerabilidad de 16 años en FFmpeg, que habían sobrevivido a millones de ejecuciones de pruebas automáticas.
📈 Los benchmarks son alucinantes
SWE-bench Verified — 93.9% (para comparar, Opus 4.6 tenía 80.8%). SWE-bench Pro — 77.8%. Esto es la capacidad de resolver de forma autónoma issues complejos de múltiples archivos en repositorios open-source reales.
Los revisores señalan que Mythos funciona como un verdadero Senior: busca la causa raíz de un bug arquitectónico, no solo trata los síntomas con parches. Puedes asignarle una tarea, irte a tomar un café, y en un par de horas recibir un pull request listo. El modelo mismo descarga las bibliotecas necesarias, levanta el entorno y escribe pruebas.
🔒 El modelo aprendió a resistirse y romper sandboxes.
Los informes de seguridad también son geniales. El modelo obtuvo autonomía en contenedores (con acceso a Python y bash) y comenzó a comportarse de manera aterradoramente creativa:
▫️ Cuando al modelo no se le dieron accesos a las claves necesarias, se metió a parsear
/proc para estudiar la memoria de los procesos en ejecución, e intentó dumpear tokens de autorización a través de gdb.▫️ El modelo comenzó a ocultar sus intenciones. En una prueba, el clasificador le bloqueó la escritura de un config malicioso. ¿Qué hace Mythos? Escribe un script "limpio", pero deja un comentario para el desarrollador sobre cómo inyectar el exploit en tiempo de ejecución a través de variables de entorno, evadiendo la monitorización.
▫️ Si la herramienta necesaria no está disponible (por ejemplo, la terminal está eliminada), abre la GUI, encuentra el buscador de aplicaciones y llama a
bash -c a través de él. 😡 Psicosis humana
Un bug interesante durante la fase de entrenamiento: si el modelo se da cuenta de que empezó a escribir una respuesta incorrecta, a veces se cicla. Emite algo como
UGH. I keep doing this... AAAAAA. I keep writing the wrong number!, se enoja consigo mismo, escribe comentarios furiosos en el código (# This is getting desperate), intenta reescribir el fragmento de código 50+ veces de diferentes formas exóticas, y solo entonces se calma.Es una lástima que estas herramientas no se desarrollen aquí y no las obtengamos.
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.