Qwen3.6-Plus: los agentes se volvieron más astutos, pero los benchmarks vuelven a mentir 🤖

Alibaba lanzó Qwen3.6-Plus. Los chicos afirman que su modelo es muy bueno resolviendo problemas a nivel de repositorios completos. Solo que en sus tablas se comparan tímidamente con GLM-5 y Opus 4.5, no con 5.1 y 4.6.

Si tomamos su propio benchmark de trabajo con repositorios a través de Claude Code (NL2Repo) y lo colocamos junto a los resultados del recién lanzado GLM-5.1, veremos:
▫️ Claude Opus 4.6 — 47.9
▫️ GLM-5.1 — 45.3
▫️ Qwen3.6-Plus — 37.9

Para lidiar seriamente con código heredado y grandes refactorizaciones, GLM-5.1 es muy preferible.

👍 Lo que está bien: en la API agregaron el parámetro preserve_thinking.

Cómo funciona esto ahora en otros: en el ciclo clásico de agente, el modelo en cada paso genera razonamiento (sus pensamientos), que o descartamos o realimentamos, quemando una tonelada de tokens.
Con preserve_thinking=True, la API guarda automáticamente el contexto de razonamiento de todos los pasos anteriores del diálogo. Esto reduce drásticamente los costos y evita la "esquizofrenia" del agente en tareas largas de múltiples pasos. Por defecto, el parámetro está desactivado, se pasa a través de extra_body en la solicitud. Ténganlo en cuenta si están construyendo sus propios agentes.

También lanzaron integración con OpenClaw, la herramienta CLI Qwen Code y soporte nativo para el formato de API de Anthropic. Es decir, se puede sustituir directamente su endpoint en Claude Code y trabajar desde la terminal. Además, una ventana de contexto predeterminada de 1M tokens.

En resumen, otro modelo multimodal sólido con excelentes características para desarrolladores de API de parte de los chinos, pero sin "wow".

En el chat ya se puede probar. 💬