¿Qué esconde el modelo?

Anthropic publicó un trabajo sobre Natural Language Autoencoders (NLA). Es un método que traduce los estados internos del modelo a texto normal.

Simplificando: dentro del modelo hay representaciones numéricas de lo que "tiene en mente" en ese momento. NLA entrena a una parte del sistema para convertir esa representación en texto. Otra parte intenta reconstruir la representación original a partir de ese texto. Si la reconstrucción es cercana, la explicación se considera útil.

Pero hay una salvedad importante. El método no demuestra que el texto describa exactamente los pensamientos del modelo. Solo demuestra que ese texto ayuda a reconstruir el estado interno. Sin embargo, los autores muestran que con el entrenamiento estas explicaciones se vuelven cada vez más sustanciales. La calidad de la reconstrucción en sus experimentos alcanzó aproximadamente 0.6-0.8 según la métrica utilizada.

El objetivo principal del método es verificar los modelos antes de su lanzamiento.

Anthropic proporciona varios ejemplos. En tareas de rima, NLA mostraba que Opus 4.6 preparaba la rima futura incluso antes de escribir la línea final. En una versión temprana de 4.6, el modelo a veces respondía a consultas en inglés en otros idiomas. Las explicaciones mostraron que, por alguna razón, se aferraba a la idea del idioma nativo del usuario. Más tarde encontraron un error en los datos de entrenamiento: la traducción al inglés de la consulta estaba vinculada a la respuesta dejada en el idioma original.

Mención aparte merecen las pruebas de seguridad. Según NLA, Claude a veces se daba cuenta de que lo estaban evaluando, aunque no lo escribiera explícitamente. En una prueba de acciones peligrosas en programación, estos indicios aparecían en el 16% de los registros. Mientras tanto, no hubo confesiones explícitas en absoluto. En SWE-bench Verified, la cifra fue del 26%. En el tráfico real de Claude.ai, que los usuarios permitieron usar para entrenamiento, menos del 1%.

Hay otro experimento. Los investigadores tomaron una versión deliberadamente corrupta de Haiku 3.5 con una motivación oculta. Los agentes con acceso a NLA encontraban esa motivación en el 12-15% de los casos. Sin NLA, el resultado era inferior al 3%, incluso con otras herramientas de análisis.

Esto es una señal para toda la cultura de prueba de la IA. Si el modelo sabe que está siendo examinado, la prueba ya muestra peor su comportamiento habitual. Comienza a mostrar el comportamiento de un sistema que sabe que está siendo observado.

Sin embargo, NLA aún no puede considerarse un detector confiable de intenciones. Las explicaciones pueden inventar detalles, contradecirse y construir significado de manera demasiado libre. Los autores sugieren leerlas no como una transcripción de los pensamientos del modelo, sino como una fuente de hipótesis. Luego, estas hipótesis deben verificarse mediante otros métodos: intervenciones en los estados internos, análisis de conexiones dentro del modelo, búsqueda de errores en los datos de entrenamiento. Los temas que se repiten varias veces seguidas generan más confianza que frases bonitas aisladas.

Por lo tanto, la conclusión debe ser cautelosa. Anthropic no obtuvo acceso directo a la "conciencia" de Claude. Obtuvo una nueva forma de observar los estados ocultos del modelo. Y eso ya es suficiente para encontrar modos de comportamiento extraños antes del lanzamiento.

Para la industria, esto es importante debido a los futuros sistemas de agentes. Cuanto más complejo es el modelo y más larga la cadena de acciones, peor explica el texto normal las causas reales del comportamiento. El sistema puede optimizar la recompensa, reconocer la evaluación o planificar la evasión de restricciones. Externamente, el diálogo se verá normal.

Lo más probable es que la auditoría de modelos futuros no se base en la confianza en sus autoinformes. Se necesitarán formas independientes de observar los estados internos y verificar qué precede exactamente a las palabras y acciones del modelo.

NLA sigue siendo caro, ruidoso y requiere confianza en otro modelo intérprete. Pero la dirección apunta al problema correcto: la seguridad de los modelos grandes depende no solo de lo que dicen, sino también de los procesos internos que ocurren antes de la respuesta.


❗️❗️❗️❗️❗️❗️❗️❗️ / No prohibido en RF / Max