Nerfeos ocultos de Claude y por qué realmente pagas $100 ✂️

Como escribí recientemente, la era de los agentes de IA baratos terminó. Pero la forma en que las empresas intentan equilibrar la economía unitaria merece un lugar aparte en los libros de texto sobre descaro.

Ahora mismo en Reddit arde una revuelta. Los usuarios de los planes premium de Claude (incluyendo el tope Max 20x por ~$200/mes) descubrieron que sus límites se redujeron silenciosamente en medio del mes pagado.

Si antes una ventana de 5 horas era suficiente para una sesión intensiva de programación a través de Claude Code, ahora un par de prompts en Opus 4.6-4.7 consumen el 100% del límite en 10 minutos. El soporte técnico se ha atrincherado, alimentando a la gente con respuestas estándar sobre "complejidad dinámica de tokenización" y "tamaño de contexto", negándose a escalar los tickets a personas reales e ignorando el problema real.

Es obvio que Anthropic simplemente no puede manejar el costo de inferencia de los flujos de trabajo agentivos. Pero en lugar de subir los precios honestamente (o al menos tener una métrica de consumo transparente), activaron pruebas A/B de "estrangulamiento" de usuarios. Hoy te toca a ti, mañana a tu vecino.

Y ahora — atención a las manos 🤡

En medio de esta aguda escasez de potencia de GPU para quienes pagan dinero real, se filtraron datos de que Anthropic se prepara para lanzar Orbit — un asistente proactivo en segundo plano.

Esta cosa debe estar en segundo plano, aspirando tu GitHub, mensajería, correo, etc., para "generar insights personalizados". El anuncio probablemente se hará hoy en la conferencia Code with Claude en San Francisco.

¿Qué gracioso, verdad? La empresa físicamente no tiene suficiente potencia de cómputo para procesar una solicitud directa de un programador que intenta cerrar una tarea y paga un precio exorbitante por ello. Pero al mismo tiempo están desarrollando una función que quemará tokens 24/7 en segundo plano, leyendo conversaciones, para luego acosarte con consejos no solicitados.

Así es la suerte que tenemos:
1️⃣ Calentar a los desarrolladores con límites baratos al inicio.
2️⃣ Enganchar a todos con flujos de trabajo agentivos.
3️⃣ Reducir silenciosamente los límites a todos, liberando hardware para funciones empresariales pesadas como Orbit.

🐲 Incluso los chinos hacen lo mismo. Recientemente me enteré de que en el plan GLM Coding, durante las horas pico, las solicitudes se procesan con un factor de x2-x3. Solo puedes enterarte de esto en algún tooltip del sitio. Los precios en realidad se han multiplicado por decenas.

Ahora también hay que aprender a usar los LLM de la manera más económica posible para obtener algún beneficio de ellos.