Der jährliche AI-Index-Bericht von Stanford ist erschienen. 400 Seiten müssen nicht gelesen werden, hier sind die wichtigsten Fakten 👇

💻 Viele Programmier-Benchmarks durchbrochen
Die Metrik SWE-bench Verified, die die Fähigkeit zur Lösung realer GitHub-Issues bewertet, stieg innerhalb eines Jahres von 60 % auf fast 100 %. Tests, die auf Jahre ausgelegt waren, werden in Monaten gesättigt. In Terminal-Bench (Agentenarbeit in einer echten Konsole: von der Kompilierung bis zum Hochfahren von Servern) stieg die Genauigkeit von 20 % auf 77,3 %.

🗑 Das Internet ist tot, Synthetik rettet nicht
Seit Januar 2025 werden >50 % der neuen Inhalte im Internet von KI generiert. Gleichzeitig gelingt es immer noch nicht, LLMs rein mit synthetischen Daten zu trainieren – die Qualität steigt nicht. Die ganze Magie liegt derzeit im datenzentrierten Ansatz. Das Modell OLMo 3.1 Think 32B erzielt Ergebnisse auf dem Niveau von Grok 4 bei 90-mal weniger Parametern. Das Geheimnis: striktes Pruning, Deduplizierung und Kuratierung des Trainingsdatensatzes, nicht gedankenloses Aufblähen der Gewichte.

⚔️ Ende des amerikanischen Monopols und Ära der Verschlossenheit
Die technologische Kluft zwischen den USA und China ist praktisch verschwunden. Chinesische Modelle liegen fast gleichauf mit den amerikanischen Flaggschiffen. Der Unterschied zwischen den Top-4-Modellen ist mikroskopisch.
Gleichzeitig ist die Industrie völlig intransparent geworden. Für die leistungsstärksten Systeme werden weder Architektur noch Trainingsskripte noch Datensatzgrößen mehr offengelegt.

🤡 Jagged Frontier (gezackte Grenze)
Neuronale Netze gewinnen Gold bei der Internationalen Mathematik-Olympiade (Gemini Deep Think erzielte 35 Punkte), können aber nicht einmal die Uhrzeit von einer analogen Uhr ablesen (Fehler in 49,9 % der Fälle, mittlerer Fehler zwischen einer und drei Stunden). Bei OSWorld (Desktop-Anwendungssteuerung) scheitern Agenten bei jeder dritten Aufgabe. Die Fähigkeit, schwierigste Mathematik zu lösen, bedeutet nicht, dass gesunder Menschenverstand vorhanden ist.

📉 Markt für Junioren bricht zusammen
Die nachgewiesene Produktivitätssteigerung von Entwicklern (+26 % abgeschlossene Pull Requests mit KI-Nutzung) trifft die Einstiegspositionen. Die Zahl der beschäftigten Programmierer im Alter von 22–25 Jahren in den USA ist im Vergleich zu 2024 um fast 20 % eingebrochen. Forscher nennen dies „seniority-biased technological change“ – KI ersetzt Juniorenarbeit, während die Einstellung älterer Entwickler weiter wächst.

🔌 Infrastrukturelle Zerbrechlichkeit
Die globalen Rechenkapazitäten für KI wachsen jedes Jahr um das 3,3-fache (erreichten 17,1 Millionen H100-Äquivalente). Die USA beherbergen über 5.400 Rechenzentren (10-mal mehr als jedes andere Land), aber fast alle fortschrittlichen KI-Chips der Welt werden in einer einzigen Fabrik von TSMC in Taiwan hergestellt. Der Energieverbrauch von KI-Rechenzentren erreichte 29,6 GW, vergleichbar mit dem Spitzenverbrauch des gesamten Bundesstaates New York.
Inferenz schlägt nicht weniger zu Buche: Der jährliche Wasserverbrauch allein für die Generierung von GPT-4o entspricht dem Trinkwasserbedarf von 1,2 Millionen Menschen.