Como escrevi recentemente, a era dos agentes de IA baratos acabou. Mas a forma como as empresas estão tentando equilibrar a economia unitária merece um lugar separado nos livros de audácia.
Neste exato momento, há uma revolta no Reddit. Usuários dos planos premium do Claude (incluindo o topo Max 20x por ~$200/mês) descobriram que seus limites foram silenciosamente reduzidos no meio do mês já pago.
Se antes uma janela de 5 horas era suficiente para uma sessão intensa de programação via Claude Code, agora alguns prompts no Opus 4.6-4.7 consomem 100% do limite em 10 minutos. O suporte técnico se fechou em uma defesa ferrenha, alimentando as pessoas com respostas padrão sobre "complexidade dinâmica de tokenização" e "tamanho de contexto", recusando-se a transferir os tickets para pessoas reais e ignorando o problema real.
Obviamente, a Anthropic simplesmente não está conseguindo arcar com o custo de inferência dos fluxos de trabalho agentivos. Mas, em vez de aumentar os preços honestamente (ou pelo menos ter uma métrica de consumo transparente), eles ativaram testes A/B de "estrangulamento" dos usuários. Hoje a sorte é sua, amanhã é do seu vizinho.
E agora — prestem atenção nas mãos 🤡
Em meio a essa escassez aguda de capacidade de GPU para quem paga dinheiro de verdade, vazaram dados de que a Anthropic está se preparando para lançar o Orbit — um assistente proativo em segundo plano.
Essa coisa deve ficar em segundo plano, varrendo seu GitHub, mensageiros, e-mail etc., para "gerar insights personalizados". O anúncio provavelmente acontecerá hoje na conferência Code with Claude em São Francisco.
Engraçado, né? A empresa não tem poder computacional suficiente para processar uma solicitação direta de um programador que está tentando concluir uma tarefa e pagando um preço exorbitante por isso. Mas, ao mesmo tempo, estão desenvolvendo um recurso que vai queimar tokens 24/7 em segundo plano, lendo conversas, para depois te encher de conselhos não solicitados.
É nessa felicidade que estamos:
1️⃣ Aquecemos os desenvolvedores com ilimitado barato no início.
2️⃣ Viciamos todos na agulha dos fluxos agentivos.
3️⃣ Cortamos silenciosamente o limite de todos, liberando hardware para recursos corporativos pesados como o Orbit.
🐲 Até os chineses estão no mesmo barco. Recentemente descobri que no GLM Coding Plan, em horários de pico, as solicitações vão com um coeficiente de x2-x3. Só é possível saber disso em algum tooltip no site. Os preços em todos os lugares, na prática, aumentaram dezenas de vezes.
Agora ainda precisamos aprender a usar LLMs da forma mais econômica possível para obter algum benefício deles.
Comentários
0Ainda não há comentários.
Entre para participar da conversa.