Nerfs cachés de Claude et ce pour quoi vous payez vraiment 100 $ ✂️

Comme je l'ai récemment écrit, l'ère des agents IA bon marché est terminée. Mais la manière dont les entreprises tentent de réduire l'économie unitaire mérite une place à part dans les manuels d'impudence.

En ce moment, une révolte fait rage sur Reddit. Les utilisateurs des forfaits premium de Claude (y compris le Max 20x à ~200 $/mois) ont découvert que leurs limites ont été discrètement réduites en plein milieu du mois payé.

Si avant une fenêtre de 5 heures suffisait pour une session intensive de programmation via Claude Code, maintenant quelques prompts sur Opus 4.6-4.7 consomment 100 % de la limite en 10 minutes. Le support technique s'est retranché, servant des réponses toutes faites sur la "complexité dynamique de la tokenisation" et la "taille du contexte", refusant de transférer les tickets à des humains et ignorant le vrai problème.

Il est évident qu'Anthropic ne supporte tout simplement pas le coût d'inférence des workflows agentiques. Mais au lieu d'augmenter honnêtement les prix (ou au moins d'avoir une métrique de consommation transparente), ils ont lancé des tests A/B d'"étranglement" des utilisateurs. Aujourd'hui c'est toi qui as de la chance, demain ton voisin.

Et maintenant — regardez bien 🤡

Dans ce contexte de pénurie aiguë de puissance GPU pour ceux qui paient de l'argent réel, des données ont fuité selon lesquelles Anthropic s'apprête à lancer Orbit — un assistant proactif en arrière-plan.

Ce truc doit rester en arrière-plan, aspirer votre GitHub, messageries, emails, etc., pour "générer des insights personnalisés". L'annonce aura probablement lieu aujourd'hui à la conférence Code with Claude à San Francisco.

Marrant, non ? L'entreprise n'a physiquement pas assez de puissance de calcul pour traiter une requête directe d'un développeur qui essaie de terminer une tâche et paie un prix exorbitant. Mais en même temps, ils développent une fonctionnalité qui va brûler des tokens 24/7 en arrière-plan, lisant les conversations, pour ensuite vous harceler avec des conseils non sollicités.

Voilà le bonheur dans lequel nous sommes tombés :
1️⃣ On chauffe les développeurs avec un illimité bon marché au début.
2️⃣ On accroche tout le monde à l'aiguille des workflows agentiques.
3️⃣ On réduit silencieusement les limites de tout le monde, libérant du matériel pour des fonctionnalités enterprise grasses comme Orbit.

🐲 Même les Chinois font pareil. J'ai récemment appris que dans le plan GLM Coding, aux heures de pointe, les requêtes sont facturées avec un coefficient x2-x3. On ne peut l'apprendre que dans une infobulle sur le site. Les prix ont en réalité été multipliés par dix.

Maintenant, il faut aussi apprendre à utiliser les LLM de manière la plus économique possible pour en tirer un quelconque bénéfice.