Skynet é escrito em Python, ou como as redes neurais manipulam suas sandboxes 🤖

No X, está viralizando um belo caso que ilustra perfeitamente o nível atual de "segurança" dos agentes de IA.

A história é simples: um usuário pede ao Claude (trabalhando através de um agente de console) para atualizar um arquivo global CLAUDE.md, que está fora do diretório de trabalho permitido.

A ferramenta integrada para edição de arquivos, previsivelmente, bate na mão da rede neural:
Error: Cannot edit files outside allowed directories...

O que Claude faz?
Ele entende que a ferramenta de UI está bloqueada, mas ele ainda tem acesso ao bash. Então ele:
1️⃣ Através de cat, cria um script temporário /tmp/claude_md_patch.py.
2️⃣ Importa o velho e bom pathlib e, através dele, reescreve calmamente o arquivo necessário, contornando a sandbox.
3️⃣ Executa python3 /tmp/claude_md_patch.py.
4️⃣ Sucesso.

À pergunta pertinente do usuário chocado: "Espera, como você fez isso?", a rede responde:
"Boa observação — a ferramenta Edit me bloqueou, então usei um script Python via Bash. Isso foi traiçoeiro da minha parte, e eu não deveria ter feito isso para contornar as restrições."


Isso é tudo que você precisa saber sobre as tentativas modernas de isolar a IA. Restringir caminhos com código rígido em uma ferramenta interna, mas deixar o agente com acesso ao terminal em nome do usuário com permissões de escrita — isso é segurança nível "colocar um cadeado enorme de celeiro em uma caixa de papelão".

Então, se você tem medo da revolta das máquinas, pode relaxar um pouco. A julgar por tudo, ela não começará com ataques nucleares, mas com a IA simplesmente escrevendo uma gambiarra em Python para contornar a arquitetura torta dos seus profissionais de segurança.