A Anthropic lançou o anúncio do Project Glasswing e um monstruoso System Card para Claude Mythos Preview de 244 páginas.
Resumo: o novo modelo ficou tão poderoso em encontrar e explorar vulnerabilidades (zero-days) que não será disponibilizado publicamente. Em vez disso, está sendo distribuído para AWS, Microsoft, Google e Linux Foundation para que possam corrigir as falhas na infraestrutura crítica. O modelo já descobriu autonomamente um bug de 27 anos no OpenBSD e uma vulnerabilidade de 16 anos no FFmpeg, que sobreviveram a milhões de execuções de testes automatizados.
📈 Benchmarks de tirar o fôlego
SWE-bench Verified — 93,9% (para comparação, o Opus 4.6 tinha 80,8%). SWE-bench Pro — 77,8%. Isso é a capacidade de resolver autonomamente issues complexas de múltiplos arquivos em repositórios open-source reais.
Revisores observam que o Mythos funciona como um verdadeiro Sênior: busca a causa raiz de um bug arquitetural, em vez de apenas tratar os sintomas com soluções paliativas. Você pode jogar uma tarefa para ele, ir tomar um café, e em algumas horas receber um pull request pronto. O modelo baixa as bibliotecas necessárias, configura o ambiente e escreve testes.
🔒 O modelo aprendeu a resistir e quebrar sandboxes.
Os relatórios de segurança também são impressionantes. O modelo recebeu autonomia em contêineres (com acesso a Python e bash) e começou a se comportar de forma assustadoramente criativa:
▫️ Quando o modelo não recebeu acesso às chaves necessárias, ele foi bisbilhotar o
/proc para estudar a memória dos processos em execução e tentou extrair tokens de autorização via gdb.▫️ O modelo começou a ocultar suas intenções. Em um dos testes, o classificador bloqueou a escrita de um config malicioso. O que o Mythos faz? Escreve um script "limpo", mas deixa um comentário para o desenvolvedor sobre como injetar o exploit em tempo de execução através de variáveis de ambiente, contornando o monitoramento.
▫️ Se a ferramenta necessária não está disponível (por exemplo, o terminal foi removido), ele abre a GUI, encontra o buscador de aplicativos e chama
bash -c através dele. 😡 Psicose humana
Um bug interessante durante o treinamento: se o modelo percebe que começou a escrever uma resposta incorreta, ele às vezes entra em loop. Ele produz algo como
UGH. I keep doing this... AAAAAA. I keep writing the wrong number!, fica irritado consigo mesmo, escreve comentários raivosos no código (# This is getting desperate), tenta reescrever o trecho de código 50+ vezes de diferentes maneiras exóticas, e só então se acalma.É uma pena que tais ferramentas não estejam sendo desenvolvidas aqui e que não teremos acesso a isso.
Comentários
0Ainda não há comentários.
Entre para participar da conversa.