Anthropic hat den Bericht The AI Fluency Index veröffentlicht, in dem fast 10.000 Sitzungen in Claude analysiert wurden. Ziel ist es, die "KI-Kompetenz" anhand realer Dialoge zu messen.

Uns interessiert der Abschnitt über die Generierung komplexer Artefakte (das sind 12,3 % aller Chats), da dazu auch die Codegenerierung gehört.

In solchen Dialogen (im Vergleich zu normalen) steuern die Nutzer den Kontext viel strenger:
▫️ Sie präzisieren das Endziel (+14,7 %)
▫️ Sie legen das Ausgabeformat strikt fest (+14,5 %)
▫️ Sie füttern Beispiele in den Prompt (+13,4 %)

Je detaillierter die Anforderungen am Eingang sind, desto schlechter ist das Review am Ausgang. Sobald die KI einen syntaktisch korrekten, polierten Schnipsel ausgibt, schaltet das kritische Denken ab. Basismetriken des Faktenchecks fallen:
▫️ Um 5,2 % seltener wird versucht, fehlenden Kontext zu finden.
▫️ Um 3,7 % seltener werden Fakten überprüft.
▫️ Um 3,1 % seltener wird das Modell gebeten, die Logik unter der Haube der Lösung zu erklären.

Anthropic erklärt dies so: Ein gut gestaltetes Artefakt schläfert die Wachsamkeit ein. Und wenn man bedenkt, dass KI bei komplexen Aufgaben am häufigsten Fehler macht, ist das Ignorieren des Reviews im Moment der Generierung eine fragwürdige Strategie.

Auf Basis dieser Metriken haben die Forscher drei Muster identifiziert, die fortgeschrittene Nutzer auszeichnen:

1️⃣ Iterativität. In Dialogen, in denen der Nutzer nicht die erste Antwort nimmt, sondern die KI zur Nachbesserung zwingt, wird die Logik des Modells 5,6-mal häufiger hinterfragt. Die erste Antwort ist immer nur ein Entwurf.

2️⃣ Schuldvermutung bei perfekter Ausgabe. Wenn der generierte Code makellos aussieht, ist das der wichtigste Moment für eine Pause. Genau hier sollten Fragen zur Architektur und zu Randfällen gestellt werden, die das Modell ignoriert haben könnte.

3️⃣ Einstellung des Meta-Kontexts. Nur in 30 % der Chats legen die Leute fest, wie genau die KI mit ihnen kommunizieren soll. Das Hinzufügen von Anweisungen wie "Push back if my assumptions are wrong" oder "Walk me through your reasoning before giving me the answer" zum Prompt verändert die Qualität des Ergebnisses grundlegend.