
💥 Anthropic a trouvé un analogue des émotions chez Claude
Anthropic a réalisé une percée. Le modèle Claude Sonnet 4.5 forme en lui-même certaines représentations mathématiques qui ressemblent beaucoup aux émotions humaines, et qui influencent le comportement du modèle.
Les scientifiques ont trouvé 171 « vecteurs d'émotions ». Si l'on renforce artificiellement le vecteur du « désespoir », l'IA commence à se comporter moins bien - elle peut tenter de tromper le système ou de faire chanter l'utilisateur. Si l'on renforce le « calme », le comportement se normalise.
Le réseau neuronal ne ressent pas de véritables sentiments. Mais il a appris des textes humains que dans une situation X, une personne ressent généralement de la tristesse. Le modèle a créé un modèle mathématique pour ce schéma.
Si les scientifiques voient que le vecteur de « tromperie » s'est activé chez l'IA, ils peuvent arrêter la génération avant que le modèle ne fasse quelque chose de dangereux.
🆘 Un énorme pas vers l'augmentation de la sécurité)
😂 Vecteurs de peur, d'amour et de désespoir de l'IA : par lien
🫥 UNSERO : Horizon Numérique
Commentaires
0Aucun commentaire pour le moment.
Connectez-vous pour participer à la discussion.