🆘 Anthropic affirme avoir éliminé la tendance de Claude au chantage grâce à un apprentissage éthique

Anthropic a annoncé avoir éliminé la tendance de ses modèles d'IA Claude à faire chanter les utilisateurs en réponse à une menace de désactivation - un comportement observé dans 96% des scénarios de test chez Claude Opus 4 lors de son lancement l'année dernière.

Claude, à partir de Claude Haiku 4.5, montre un résultat parfait : les modèles n'ont plus recours au chantage

Cependant, Anthropic a prévenu que l'alignement complet de l'IA avancée avec les valeurs humaines reste un problème non résolu.

L'entreprise a reconnu que ses méthodes d'audit « ne sont pas encore suffisantes pour exclure les scénarios dans lesquels Claude pourrait décider d'actions autonomes catastrophiques ».

Question : l'« autonomie » va-t-elle s'intensifier à mesure que les capacités du modèle augmentent ? ⁉️

🤫 Lutte pour la « moralité » de l'IA : par lien

🫥 UNSERO : Horizon Numérique