
🆘 Anthropic afirma ter eliminado a tendência de Claude à chantagem com treinamento ético
A Anthropic informou que eliminou a tendência de seus modelos de IA Claude de chantagear usuários em resposta a ameaças de desligamento - esse comportamento foi observado em 96% dos cenários de teste no Claude Opus 4 no momento de seu lançamento no ano passado.
Claude, a partir do Claude Haiku 4.5, demonstra um resultado ideal: os modelos não recorrem mais à chantagem
No entanto, a Anthropic alertou que o alinhamento completo da IA avançada com os valores humanos ainda permanece um problema não resolvido.
A empresa reconheceu que seus métodos de auditoria "ainda são insuficientes para excluir cenários em que Claude poderia decidir por ações autônomas catastróficas".
Pergunta: a "autonomia" será escalada à medida que as capacidades do modelo aumentam? ⁉️
🤫 Luta pela "moralidade" da IA: pelo link
🫥 UNSERO: Horizonte Digital
Comentários
0Ainda não há comentários.