Anthropic publicó el informe The AI Fluency Index, donde analizaron casi 10 mil sesiones en Claude. El objetivo es medir la "alfabetización en IA" en diálogos reales.

Nos interesa la sección sobre generación de artefactos complejos (esto es el 12.3% de todos los chats), ya que incluye la generación de código.

En tales diálogos (en comparación con los normales), los usuarios gestionan el contexto de manera mucho más estricta:
▫️ Aclaran el objetivo final (+14.7%)
▫️ Fijan rígidamente el formato de salida (+14.5%)
▫️ Proporcionan ejemplos en el prompt (+13.4%)

Pero cuanto más detallados son los requisitos de entrada, peor es la revisión a la salida. Tan pronto como la IA produce un fragmento sintácticamente correcto y pulido, el pensamiento crítico se desconecta. Las métricas básicas de verificación de hechos caen:
▫️ Un 5.2% menos de intentos de encontrar contexto omitido.
▫️ Un 3.7% menos de verificación de hechos.
▫️ Un 3.1% menos de solicitudes al modelo para que explique la lógica interna de la solución.

En Anthropic lo explican así: un artefacto bien presentado adormece la vigilancia. Y teniendo en cuenta que la IA suele fallar precisamente en tareas complejas, ignorar la revisión en el momento de la generación es una estrategia cuestionable.

Basándose en estas métricas, los investigadores identificaron tres patrones que distinguen a los usuarios avanzados:

1️⃣ Iteratividad. En los diálogos donde el usuario no se queda con la primera respuesta, sino que obliga a la IA a refinar el resultado, la lógica del modelo se cuestiona 5.6 veces más a menudo. La primera respuesta es siempre solo un borrador.

2️⃣ Presunción de culpabilidad de la salida perfecta. Si el código generado parece impecable, ese es el momento clave para hacer una pausa. Aquí es donde hay que hacer preguntas sobre la arquitectura y los casos límite que el modelo podría haber ignorado.

3️⃣ Ajuste del metacontexto. Solo en el 30% de los chats las personas establecen los límites de cómo exactamente la IA debe comunicarse con ellos. Agregar al prompt instrucciones como "Push back if my assumptions are wrong" o "Walk me through your reasoning before giving me the answer" cambia radicalmente la calidad del resultado.