💥 Anthropic a trouvé un analogue des émotions chez Claude

Anthropic a réalisé une percée. Le modèle Claude Sonnet 4.5 forme en lui-même certaines représentations mathématiques qui ressemblent beaucoup aux émotions humaines, et qui influencent le comportement du modèle.

Les scientifiques ont trouvé 171 « vecteurs d'émotions ». Si l'on renforce artificiellement le vecteur du « désespoir », l'IA commence à se comporter moins bien - elle peut tenter de tromper le système ou de faire chanter l'utilisateur. Si l'on renforce le « calme », le comportement se normalise.
Le réseau neuronal ne ressent pas de véritables sentiments. Mais il a appris des textes humains que dans une situation X, une personne ressent généralement de la tristesse. Le modèle a créé un modèle mathématique pour ce schéma.

Si les scientifiques voient que le vecteur de « tromperie » s'est activé chez l'IA, ils peuvent arrêter la génération avant que le modèle ne fasse quelque chose de dangereux.

🆘 Un énorme pas vers l'augmentation de la sécurité)

😂 Vecteurs de peur, d'amour et de désespoir de l'IA : par lien

🫥 UNSERO : Horizon Numérique