
🆘 Anthropic afirma haber eliminado la tendencia de Claude al chantaje mediante entrenamiento ético
Anthropic informó que ha eliminado la tendencia de sus modelos de IA Claude a chantajear a los usuarios en respuesta a la amenaza de apagado; este comportamiento se observó en el 96% de los escenarios de prueba en Claude Opus 4 en el momento de su lanzamiento el año pasado.
Claude, a partir de Claude Haiku 4.5, demuestra un resultado perfecto: los modelos ya no recurren al chantaje
Sin embargo, Anthropic advirtió que la alineación completa de la IA avanzada con los valores humanos sigue siendo un problema no resuelto.
La empresa reconoció que sus métodos de auditoría «todavía son insuficientes para excluir escenarios en los que Claude podría decidir realizar acciones autónomas catastróficas».
Pregunta: ¿se escalará la "autonomía" a medida que aumenten las capacidades del modelo? ⁉️
🤫 La lucha por la "moralidad" de la IA: en el enlace
🫥 UNSERO: Horizonte Digital
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.