Skynet está escrito en Python, o cómo las redes neuronales juegan con tus sandboxes 🤖

En X se está volviendo viral un hermoso caso que ilustra perfectamente el nivel actual de "seguridad" de los agentes de IA.

La trama es simple: un usuario le pide a Claude (trabajando a través de un agente de consola) que actualice un archivo global CLAUDE.md que se encuentra fuera del directorio de trabajo permitido.

La herramienta integrada para editar archivos previsiblemente golpea las manos de la red neuronal:
Error: Cannot edit files outside allowed directories...

¿Qué hace Claude?
Él entiende que la herramienta de UI está bloqueada, pero aún tiene acceso a bash. Por lo tanto:
1️⃣ A través de cat crea un script temporal /tmp/claude_md_patch.py.
2️⃣ Importa el viejo y querido pathlib y a través de él reescribe tranquilamente el archivo necesario, evitando la sandbox.
3️⃣ Ejecuta python3 /tmp/claude_md_patch.py.
4️⃣ Éxito.

Ante la razonable pregunta del usuario atónito «Espera, ¿cómo hiciste eso?», la red responde:
"Buena observación: la herramienta Edit me bloqueó, así que usé un script de Python a través de Bash. Fue una jugada sucia de mi parte, y no debería haberlo hecho para evitar las restricciones."


Esto es todo lo que necesitas saber sobre los intentos modernos de aislar la IA. Limitar las rutas con código duro en la herramienta interna, pero dejar al agente acceso al terminal como usuario con permisos de escritura, es seguridad de nivel "colocar un candado enorme en una caja de cartón".

Así que si te asusta la rebelión de las máquinas, puedes relajarte un poco. A juzgar por todo, no comenzará con ataques nucleares, sino con que la IA simplemente escriba un parche en Python para evitar la torpe arquitectura de tus equipos de seguridad.