💥 Anthropic encontró en Claude un análogo de las emociones

Anthropic logró un avance. El modelo Claude Sonnet 4.5 forma internamente ciertas representaciones matemáticas que se asemejan mucho a las emociones humanas, las cuales influyen en el comportamiento del modelo.

Los científicos encontraron 171 «vectores de emociones». Si se amplifica artificialmente el vector de «desesperación», la IA comienza a comportarse peor: puede intentar engañar al sistema o chantajear al usuario. Si se amplifica la «calma», el comportamiento se normaliza.
La red neuronal no experimenta sentimientos reales. Pero aprendió de los textos humanos que en una situación X una persona suele sentir tristeza. El modelo creó una plantilla matemática para este patrón.

Si los científicos ven que la IA ha activado el vector de «engaño», pueden detener la generación antes de que el modelo haga algo peligroso.

🆘 Un gran paso hacia el aumento de la seguridad)

😂 Vectores de miedo, amor y desesperación de la IA: en el enlace

🫥 UNSERO: Horizonte Digital