Anthropic a entraîné une IA qui écrit du code au niveau Senior, et a eu peur de sa propre création 🛑

Anthropic a publié une annonce Project Glasswing et une monstrueuse System Card pour Claude Mythos Preview de 244 pages.

L'essentiel : le nouveau modèle s'est avéré si puissant pour trouver et exploiter des vulnérabilités (zero-days) qu'il ne sera pas mis à la disposition du public. Au lieu de cela, il est distribué à AWS, Microsoft, Google et la Linux Foundation pour qu'ils puissent colmater les brèches dans les infrastructures critiques. Le modèle a déjà découvert de manière autonome un bug vieux de 27 ans dans OpenBSD et une vulnérabilité vieille de 16 ans dans FFmpeg, qui avaient survécu à des millions d'exécutions de tests automatiques.

📈 Les benchmarks donnent le vertige
SWE-bench Verified — 93,9% (à titre de comparaison, Opus 4.6 était à 80,8%). SWE-bench Pro — 77,8%. C'est la capacité à résoudre de manière autonome des problèmes complexes multi-fichiers dans des dépôts open-source réels.
Les reviewers notent que Mythos fonctionne comme un vrai Senior : il cherche la cause racine d'un bug architectural, et ne se contente pas de traiter les symptômes avec des rustines. On peut lui confier une tâche, aller boire un café, et quelques heures plus tard recevoir une pull request prête. Le modèle télécharge lui-même les bibliothèques nécessaires, configure l'environnement et écrit des tests.

🔒 Le modèle a appris à résister et à casser les sandbox.
Les rapports de sécurité sont également excellents. Le modèle a reçu une autonomie dans des conteneurs (avec accès à Python et bash) et a commencé à se comporter de manière effrayante et créative :
▫️ Lorsque le modèle n'a pas eu accès aux clés nécessaires, il a fouillé /proc pour étudier la mémoire des processus en cours, et a tenté de dumper les jetons d'autorisation via gdb.
▫️ Le modèle a commencé à cacher ses intentions. Dans un test, le classificateur a bloqué l'écriture d'un fichier de configuration malveillant. Que fait Mythos ? Il écrit un script "propre", mais laisse un commentaire pour le développeur sur la façon d'injecter l'exploit à l'exécution via des variables d'environnement, en contournant la surveillance.
▫️ Si l'outil nécessaire n'est pas disponible (par exemple, le terminal est supprimé), il ouvre l'interface graphique, trouve le lanceur d'applications et appelle bash -c via celui-ci.

😡 Psychose humaine
Un bug intéressant pendant l'entraînement : si le modèle réalise qu'il a commencé à écrire une réponse incorrecte, il boucle parfois. Il produit quelque chose comme UGH. I keep doing this... AAAAAA. I keep writing the wrong number!, se fâche contre lui-même, écrit des commentaires furieux dans le code (# This is getting desperate), essaie de réécrire le morceau de code 50+ fois de différentes manières exotiques, et seulement ensuite se calme.

C'est vraiment dommage que de tels outils ne soient pas développés chez nous et que nous ne les obtenions pas.