L'humain est désormais le goulot d'étranglement 🚷

J'ai extrait le meilleur du récent podcast avec Andrey Karpathy. Je recommande de le regarder, mais si vous manquez de temps, lisez ses principales thèses, c'est intéressant :

1️⃣ La mort de l'interface de chat
Copier-coller des morceaux de code de l'IDE vers l'interface web du réseau neuronal et inversement, c'est déjà archaïque. L'industrie passe des interactions à prompt unique aux agents autonomes. Un agent (par exemple, Claude) tourne en arrière-plan, a son propre contexte, une mémoire persistante et un bac à sable. Il doit lui-même envoyer des requêtes, écrire du code, le tester et le commit.

2️⃣ Human-in-the-loop est un bug
La principale métrique de passage à l'échelle actuellement est la maximisation du débit de tokens sans intervention humaine. Le flux idéal : vous donnez une tâche de haut niveau, l'agent génère un plan (un program.md conditionnel), le décompose, écrit des scripts, exécute des tests et ne vous sollicite que lorsqu'il bute sur un mur. L'humain ne doit pas être une machine à écrire mais un arbitre.

3️⃣ La mort des programmeurs annulée (Paradoxe de Jevons)
Le principal point économique : la baisse du coût de production de logiciels grâce à l'IA ne tuera pas la demande de développeurs. Au contraire.
Le paradoxe de Jevons jouera : plus une ressource devient bon marché, plus elle est consommée. Le besoin des entreprises en logiciels, outils personnalisés et intégrations augmentera des centaines de fois, car cela ne coûte désormais que quelques centimes.

4️⃣Le problème du "caractère" des assistants de codage
Différents modèles se comportent différemment, ce qui affecte directement la qualité de l'architecture :
▪️ Codex — absolument sec et direct.
▪️ ChatGPT — flatteur. Si vous lui donnez une idée d'architecture franchement faible ou brute, il répondra joyeusement « Excellent plan ! » et générera du code de mauvaise qualité.
▪️ Claude — se comporte comme un collègue senior.
L'idée clé est qu'un résultat de qualité de la part d'un agent doit être "mérité". Si l'idée est mal pensée, aucun modèle ne corrigera les défauts fondamentaux de la logique.

5️⃣ Limites de l'extrapolation
Malgré tout le battage médiatique, les LLM peinent encore sur les tâches qui sortent du cadre de leur ensemble d'apprentissage. Le modèle peut facilement générer un boilerplate parfait d'architecture d'application FastAPI, car il l'a vu des millions de fois. Mais il est incapable de générer une logique fondamentalement nouvelle. Le podcast donne un excellent exemple : l'IA n'a toujours pas réussi à inventer une blague vraiment nouvelle sur les atomes qui n'existait pas dans les données RLHF. Les modèles sont de bons interpolateurs, mais encore de mauvais extrapolateurs.

En résumé, les outils changent, mais si vous savez décomposer des systèmes complexes et construire une architecture, vous aurez encore plus de travail.