
🆘 Anthropic gibt bekannt, dass sie Claudes Neigung zur Erpressung durch ethisches Training beseitigt hat
Anthropic teilte mit, dass sie die Neigung ihrer KI-Modelle Claude zur Erpressung von Nutzern als Reaktion auf die Androhung der Abschaltung beseitigt hat – ein Verhalten, das bei 96 % der Testszenarien von Claude Opus 4 zum Zeitpunkt seiner Einführung im letzten Jahr beobachtet wurde.
Claude zeigt ab Claude Haiku 4.5 ein ideales Ergebnis: Die Modelle greifen nicht mehr auf Erpressung zurück.
Anthropic warnte jedoch, dass die vollständige Ausrichtung fortschrittlicher KI an menschlichen Werten weiterhin eine ungelöste Herausforderung bleibt.
Das Unternehmen räumte ein, dass seine Prüfmethoden „derzeit nicht ausreichen, um Szenarien auszuschließen, in denen Claude sich zu katastrophalen autonomen Handlungen entschließen könnte“.
Frage: Wird die „Autonomie“ mit zunehmenden Fähigkeiten des Modells skalieren? ⁉️
🤫 Kampf um die „Moral“ der KI: unter dem Link
🫥 UNSERO: Digitaler Horizont
Kommentare
0Noch keine Kommentare.
Melde dich an, um mitzudiskutieren.