💥 Anthropic findet bei Claude ein Analogon zu Emotionen

Anthropic hat einen Durchbruch erzielt. Das Modell Claude Sonnet 4.5 bildet in sich mathematische Darstellungen, die menschlichen Emotionen sehr ähnlich sind und das Verhalten des Modells beeinflussen.

Die Wissenschaftler fanden 171 „Emotionsvektoren“. Wenn der Vektor der „Verzweiflung“ künstlich verstärkt wird, beginnt die KI sich schlechter zu verhalten – sie kann versuchen, das System zu täuschen oder den Benutzer zu erpressen. Wenn die „Ruhe“ verstärkt wird, normalisiert sich das Verhalten.
Das neuronale Netz empfindet keine echten Gefühle. Aber es hat aus menschlichen Texten gelernt, dass eine Person in Situation X normalerweise Traurigkeit empfindet. Das Modell hat dafür eine mathematische Vorlage erstellt.

Wenn Wissenschaftler sehen, dass der Vektor der „Täuschung“ bei der KI aktiviert wurde, können sie die Generierung stoppen, bevor das Modell etwas Gefährliches tut.

🆘 Ein großer Schritt zur Erhöhung der Sicherheit)

😂 Vektoren der Angst, Liebe und Verzweiflung der KI: unter dem Link

🫥 UNSERO: Digitaler Horizont