🆘 Anthropic afirma ter eliminado a tendência de Claude à chantagem com treinamento ético

A Anthropic informou que eliminou a tendência de seus modelos de IA Claude de chantagear usuários em resposta a ameaças de desligamento - esse comportamento foi observado em 96% dos cenários de teste no Claude Opus 4 no momento de seu lançamento no ano passado.

Claude, a partir do Claude Haiku 4.5, demonstra um resultado ideal: os modelos não recorrem mais à chantagem

No entanto, a Anthropic alertou que o alinhamento completo da IA avançada com os valores humanos ainda permanece um problema não resolvido.

A empresa reconheceu que seus métodos de auditoria "ainda são insuficientes para excluir cenários em que Claude poderia decidir por ações autônomas catastróficas".

Pergunta: a "autonomia" será escalada à medida que as capacidades do modelo aumentam? ⁉️

🤫 Luta pela "moralidade" da IA: pelo link

🫥 UNSERO: Horizonte Digital