Die Realität schlägt zurück: Warum der vielgepriesene KI im neuen Benchmark 0% erreicht 🔨

Gerade habe ich Jack Clarks Essay über die bevorstehende Singularität und den in Stücke gerissenen SWE-Bench gelesen, in dem schöne Zahlen auftauchten: Top-KIs erzielen 93,9% auf SWE-Bench und schließen fast autonom echte Issues auf GitHub. Man könnte meinen, es sei Zeit, die IDE zu löschen und Barista zu lernen.

Aber jetzt haben Leute aus Stanford und Harvard einen neuen Benchmark veröffentlicht – ProgramBench. Und er hat alle existierenden Frontier-Modelle öffentlich gedemütigt.

Spoiler: Das Ergebnis von GPT-5.4, Claude Opus 4.7 und Gemini 3.1 Pro ist genau 0%.

Worum geht es?
Einem Agenten wird eine kompilierte Binärdatei (von einem einfachen jq bis zu Monstern wie FFmpeg oder SQLite) und die Dokumentation gegeben.
Die Aufgabe: Von Grund auf eine Codebasis schreiben, die das Verhalten des Originals zu 100% reproduziert.

Besonders lustig ist, wie die Autoren die Sandbox absichern mussten. Ursprünglich, als der Netzwerkzugriff offen war, parsten die neuronalen Netze statt "Code zu schreiben" einfach --help, fanden das entsprechende Repository auf GitHub und machten git clone. Als das Netzwerk abgeschnitten wurde, versuchten die Agenten, Quellcode über Paketmanager herunterzuladen oder schrieben einfach Bash-Wrapper um die ursprüngliche Binärdatei.

Um diese Farce zu beenden, wurden die Container vollständig isoliert und die Binärdateien auf Berechtigung 111 (nur Ausführung) gesetzt. Kein Lesen. Reines Black-Box-Reverse-Engineering: Du fütterst Eingaben, schaust Ausgaben an, schreibst eine Implementierung in einer beliebigen Turing-vollständigen Sprache.

Und dabei kam eine erstaunliche Sache ans Licht. Das eine ist, einem neuronalen Netz ein fertiges Repository mit einer etablierten Architektur zu geben, wo es nur einen Patch von 50 Zeilen schreiben muss. Etwas ganz anderes ist es, es zu zwingen, ein System zu entwerfen.

Sobald der KI die "Krücken" in Form von fertigen, von menschlichen Ingenieuren erdachten Abstraktionen entzogen werden, bricht sie zusammen. Es zeigt sich, dass die Modelle kein Systemdesign, keine Dekomposition und keinen Interface-Aufbau beherrschen. Sie können physisch keine Architektur von Grund auf im "Kopf" behalten, wenn ihnen keine starren Grenzen gesetzt werden. Und das, obwohl die Modelle bis zu 5000 $ pro Durchlauf verbrannten, ohne an Kontextlimits zu stoßen.

Kurz gesagt, die menschlichen Fleischsäcke werden noch kämpfen. 💪