Nos interessa a seção sobre geração de artefatos complexos (que representa 12,3% de todos os chats), pois inclui a geração de código.
Nesses diálogos (em comparação com os comuns), os usuários gerenciam o contexto de forma muito mais rigorosa:
▫️ Esclarecem o objetivo final (+14,7%)
▫️ Fixam rigidamente o formato de saída (+14,5%)
▫️ Fornecem exemplos no prompt (+13,4%)
Mas quanto mais detalhada a especificação na entrada, pior a revisão na saída. Assim que a IA produz um snippet sintaticamente correto e polido, o pensamento crítico é desligado. As métricas básicas de verificação de fatos caem:
▫️ 5,2% menos tentativas de encontrar contexto perdido.
▫️ 3,7% menos verificações de fatos.
▫️ 3,1% menos pedidos para o modelo explicar a lógica por trás da solução.
A Anthropic explica assim: um artefato bem formatado adormece a vigilância. E considerando que a IA geralmente erra em tarefas complexas, ignorar a revisão no momento da geração é uma estratégia duvidosa.
Com base nessas métricas, os pesquisadores identificaram três padrões que diferenciam usuários avançados:
1️⃣ Iteratividade. Em diálogos onde o usuário não aceita a primeira resposta, mas faz a IA refinar o resultado, a lógica do modelo é contestada 5,6 vezes mais. A primeira resposta é sempre apenas um rascunho.
2️⃣ Presunção de culpa da saída perfeita. Se o código gerado parece impecável, esse é o principal momento para pausar. É aqui que se deve questionar a arquitetura e os casos extremos que o modelo pode ter ignorado.
3️⃣ Configuração do meta-contexto. Apenas em 30% dos chats as pessoas definem limites de como exatamente a IA deve se comunicar com elas. Adicionar instruções ao prompt como "Push back if my assumptions are wrong" ou "Walk me through your reasoning before giving me the answer" muda radicalmente a qualidade do resultado.
Comentários
0Ainda não há comentários.
Entre para participar da conversa.