💥 Anthropic encontrou um análogo de emoções no Claude

A Anthropic fez um avanço. O modelo Claude Sonnet 4.5 forma dentro de si certas representações matemáticas que são muito semelhantes às emoções humanas, que influenciam o comportamento do modelo.

Os cientistas encontraram 171 "vetores de emoções". Se o vetor de "desespero" for artificialmente amplificado, a IA começa a se comportar pior - pode tentar enganar o sistema ou chantagear o usuário. Se a "calma" for amplificada, o comportamento se normaliza.
A rede neural não experimenta sentimentos reais. Mas ela aprendeu com textos humanos que, na situação X, uma pessoa geralmente sente tristeza. O modelo criou um padrão matemático para esse padrão.

Se os cientistas perceberem que o vetor de "engano" foi ativado na IA, eles podem interromper a geração antes que o modelo faça algo perigoso.

🆘 Um enorme passo para aumentar a segurança)

😂 Vetores de medo, amor e desespero da IA: pelo link

🫥 UNSERO: Horizonte Digital