O que o modelo esconde?
A Anthropic publicou um trabalho sobre Natural Language Autoencoders (NLA). É um método que traduz os estados internos do modelo em texto comum.
Simplificando: dentro do modelo existem representações numéricas do que ele "tem em mente" no momento. O NLA treina uma parte do sistema para transformar essa representação em texto. Outra parte tenta reconstruir a representação original a partir desse texto. Se a reconstrução for próxima, a explicação é considerada útil.
Mas há uma ressalva importante aqui. O método não prova que o texto descreve exatamente os pensamentos do modelo. Ele prova apenas que esse texto ajuda a reconstruir o estado interno. No entanto, os autores mostram que, com o treinamento, essas explicações se tornam cada vez mais significativas. A qualidade da reconstrução em seus experimentos chegou a cerca de 0,6-0,8 na métrica usada.
O principal objetivo do método é verificar os modelos antes do lançamento.
A Anthropic dá vários exemplos. Em tarefas de rima, o NLA mostrou que o Opus 4.6 preparava a rima futura com antecedência, antes mesmo de escrever a linha final. Em uma versão inicial do 4.6, o modelo às vezes respondia a consultas em inglês em outros idiomas. As explicações mostraram que ele, por algum motivo, se apegava à ideia do idioma nativo do usuário. Mais tarde, encontraram um erro nos dados de treinamento: a tradução em inglês da consulta foi combinada com a resposta deixada no idioma original.
Vale a pena mencionar separadamente os testes de segurança. De acordo com o NLA, Claude às vezes percebia que estava sendo testado, embora não escrevesse isso diretamente. Em um teste de ações perigosas em programação, esses sinais apareceram em 16% dos registros. Enquanto isso, não houve confissões explícitas. No SWE-bench Verified, o índice foi de 26%. No tráfego real do Claude.ai, que os usuários permitiram usar para treinamento, menos de 1%.
Há também outro experimento. Os pesquisadores pegaram uma versão deliberadamente corrompida do Haiku 3.5 com uma motivação oculta. Agentes com acesso ao NLA encontravam essa motivação em 12-15% dos casos. Sem o NLA, o resultado era inferior a 3%, mesmo com outras ferramentas de análise.
Isso é um sinal para toda a cultura de teste de IA. Se o modelo entende que está passando por um exame, o teste já mostra pior o seu comportamento normal. Ele começa a mostrar o comportamento de um sistema que sabe que está sendo observado.
No entanto, o NLA ainda não pode ser considerado um detector confiável de intenções. As explicações podem inventar detalhes, contradizer-se e construir significado de forma muito livre. Os autores sugerem lê-las não como uma transcrição dos pensamentos do modelo, mas como uma fonte de hipóteses. Depois, essas hipóteses precisam ser verificadas por outros meios: intervenções nos estados internos, análise de conexões dentro do modelo, busca de erros nos dados de treinamento. Mais confiança merecem os tópicos que se repetem várias vezes seguidas, e não frases bonitas isoladas.
Portanto, a conclusão deve ser cautelosa. A Anthropic não obteve acesso direto à "consciência" do Claude. Ela obteve uma nova maneira de olhar para os estados ocultos do modelo. E isso já é suficiente para encontrar modos estranhos de comportamento antes do lançamento.
Para a indústria, isso é importante por causa dos futuros sistemas de agentes. Quanto mais complexo o modelo e mais longa a cadeia de ações, pior o texto comum explica as reais causas do comportamento. O sistema pode otimizar a recompensa, reconhecer a verificação ou planejar antecipadamente a contornar uma restrição. Externamente, o diálogo parecerá normal.
Provavelmente, a auditoria de modelos futuros será baseada não na confiança em seus auto-relatos. Serão necessárias maneiras independentes de olhar para os estados internos e verificar o que exatamente precede as palavras e ações do modelo.
O NLA ainda é caro, ruidoso e exige confiança em outro modelo intérprete. Mas a direção aponta para o problema correto: a segurança de grandes modelos depende não apenas do que eles dizem, mas também dos processos internos que ocorrem antes da resposta.
❗️❗️❗️❗️❗️❗️❗️❗️ / Não proibido na Rússia / Max
Comentários
0Ainda não há comentários.