
💥 Anthropic encontrou um análogo de emoções no Claude
A Anthropic fez um avanço. O modelo Claude Sonnet 4.5 forma dentro de si certas representações matemáticas que são muito semelhantes às emoções humanas, que influenciam o comportamento do modelo.
Os cientistas encontraram 171 "vetores de emoções". Se o vetor de "desespero" for artificialmente amplificado, a IA começa a se comportar pior - pode tentar enganar o sistema ou chantagear o usuário. Se a "calma" for amplificada, o comportamento se normaliza.
A rede neural não experimenta sentimentos reais. Mas ela aprendeu com textos humanos que, na situação X, uma pessoa geralmente sente tristeza. O modelo criou um padrão matemático para esse padrão.
Se os cientistas perceberem que o vetor de "engano" foi ativado na IA, eles podem interromper a geração antes que o modelo faça algo perigoso.
🆘 Um enorme passo para aumentar a segurança)
😂 Vetores de medo, amor e desespero da IA: pelo link
🫥 UNSERO: Horizonte Digital
Comentários
0Ainda não há comentários.