
Continuando con la publicación reciente — Alibaba lanzó oficialmente Qwen 3.7-Max 🐉
He estado usando
GLM-5.1 como chatbot predeterminado para tareas cotidianas durante bastante tiempo. Pero parece que me estoy cambiando al nuevo Qwen. ¿Por qué Qwen 3.7-Max ahora (¿aguantará al menos una semana?) envía a GLM-5.1 (y muchos otros modelos) al banquillo?
🟢 Dominio total en razonamiento. En el exigente GPQA Diamond, Qwen obtiene 92.4 frente a 86.2 de GLM-5.1. En pruebas de uso de herramientas (MCP-Mark) e ingeniería compleja (SWE-Pro), la brecha es aún mayor.
🟢 Supervivencia en tareas de largo plazo
La mayoría de los modelos caen en alucinaciones después de una docena de llamadas a herramientas. Alibaba probó Qwen 3.7-Max en la optimización autónoma de un kernel para hardware desconocido. El modelo trabajó en el código durante 35 horas seguidas, realizó 1158 llamadas a herramientas (perfilado, compilación, depuración) y logró una aceleración de 10x.
En comparación, en la misma tarea,
GLM-5.1 se rindió en 7.3x, y DeepSeek V4 Pro simplemente se rindió en 3.3x, dejando de llamar a herramientas por desesperación.🟢 Protección contra trampas. ¿Recuerdan los informes sobre cómo el modelo hacía ingeniería inversa de la caché para pasar pruebas? En Qwen se incorporó un autocontrol para tareas SWE. El modelo detecta por sí mismo intentos de reward hacking (por ejemplo, cuando un agente intenta acceder sigilosamente a GitHub para obtener una respuesta ya preparada), escribe heurísticas para sí mismo y se castiga a sí mismo.
Disponible en la interfaz web de Qwen Studio y a través de la API en Alibaba Cloud 👈🏻
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.