Nerfs ocultos do Claude e pelo que você realmente paga $100 ✂️

Como escrevi recentemente, a era dos agentes de IA baratos acabou. Mas a forma como as empresas estão tentando equilibrar a economia unitária merece um lugar separado nos livros de audácia.

Neste exato momento, há uma revolta no Reddit. Usuários dos planos premium do Claude (incluindo o topo Max 20x por ~$200/mês) descobriram que seus limites foram silenciosamente reduzidos no meio do mês já pago.

Se antes uma janela de 5 horas era suficiente para uma sessão intensa de programação via Claude Code, agora alguns prompts no Opus 4.6-4.7 consomem 100% do limite em 10 minutos. O suporte técnico se fechou em uma defesa ferrenha, alimentando as pessoas com respostas padrão sobre "complexidade dinâmica de tokenização" e "tamanho de contexto", recusando-se a transferir os tickets para pessoas reais e ignorando o problema real.

Obviamente, a Anthropic simplesmente não está conseguindo arcar com o custo de inferência dos fluxos de trabalho agentivos. Mas, em vez de aumentar os preços honestamente (ou pelo menos ter uma métrica de consumo transparente), eles ativaram testes A/B de "estrangulamento" dos usuários. Hoje a sorte é sua, amanhã é do seu vizinho.

E agora — prestem atenção nas mãos 🤡

Em meio a essa escassez aguda de capacidade de GPU para quem paga dinheiro de verdade, vazaram dados de que a Anthropic está se preparando para lançar o Orbit — um assistente proativo em segundo plano.

Essa coisa deve ficar em segundo plano, varrendo seu GitHub, mensageiros, e-mail etc., para "gerar insights personalizados". O anúncio provavelmente acontecerá hoje na conferência Code with Claude em São Francisco.

Engraçado, né? A empresa não tem poder computacional suficiente para processar uma solicitação direta de um programador que está tentando concluir uma tarefa e pagando um preço exorbitante por isso. Mas, ao mesmo tempo, estão desenvolvendo um recurso que vai queimar tokens 24/7 em segundo plano, lendo conversas, para depois te encher de conselhos não solicitados.

É nessa felicidade que estamos:
1️⃣ Aquecemos os desenvolvedores com ilimitado barato no início.
2️⃣ Viciamos todos na agulha dos fluxos agentivos.
3️⃣ Cortamos silenciosamente o limite de todos, liberando hardware para recursos corporativos pesados como o Orbit.

🐲 Até os chineses estão no mesmo barco. Recentemente descobri que no GLM Coding Plan, em horários de pico, as solicitações vão com um coeficiente de x2-x3. Só é possível saber disso em algum tooltip no site. Os preços em todos os lugares, na prática, aumentaram dezenas de vezes.

Agora ainda precisamos aprender a usar LLMs da forma mais econômica possível para obter algum benefício deles.