Anthropic a publié le rapport The AI Fluency Index, où ils ont analysé près de 10 000 sessions dans Claude. L'objectif est de mesurer la "littératie en IA" à partir de dialogues réels.

Ce qui nous intéresse, c'est la section sur la génération d'artefacts complexes (cela représente 12,3 % de tous les chats), car la génération de code en fait partie.

Dans ces dialogues (par rapport aux dialogues ordinaires), l'utilisateur gère le contexte de manière beaucoup plus stricte :
▫️ Il précise l'objectif final (+14,7 %)
▫️ Il fixe rigoureusement le format de sortie (+14,5 %)
▫️ Il fournit des exemples dans le prompt (+13,4 %)

Mais plus le cahier des charges est détaillé en entrée, moins la relecture est bonne en sortie. Dès que l'IA produit un extrait syntaxiquement correct et poli, la pensée critique se désactive. Les métriques de base du fact-checking chutent :
▫️ On essaie 5,2 % moins souvent de trouver le contexte manquant.
▫️ On vérifie les faits 3,7 % moins souvent.
▫️ On demande 3,1 % moins souvent au modèle d'expliquer la logique sous le capot de la solution.

Chez Anthropic, ils expliquent cela ainsi : un artefact bien présenté endort la vigilance. Et étant donné que l'IA se trompe le plus souvent sur les tâches complexes, ignorer la relecture au moment de la génération est une stratégie discutable.

Sur la base de ces métriques, les chercheurs ont identifié trois schémas qui distinguent les utilisateurs avancés :

1️⃣ Itérativité. Dans les dialogues où l'utilisateur ne prend pas la première réponse mais force l'IA à améliorer le résultat, la logique du modèle est contestée 5,6 fois plus souvent. La première réponse n'est toujours qu'un brouillon.

2️⃣ Présomption de culpabilité de la sortie parfaite. Si le code généré semble impeccable, c'est le moment clé pour faire une pause. C'est là qu'il faut poser des questions sur l'architecture et les cas limites que le modèle a pu ignorer.

3️⃣ Configuration du méta-contexte. Seulement dans 30 % des chats, les gens définissent le cadre de comment l'IA doit communiquer avec eux. Ajouter au prompt des instructions comme "Push back if my assumptions are wrong" ou "Walk me through your reasoning before giving me the answer" change radicalement la qualité du résultat.