Qwen3.6-Plus: ajanlar daha akıllı hale geldi, ancak kıyaslamalar yine yalan söylüyor 🤖

Alibaba Qwen3.6-Plus'ı yayınladı. Ekip, modellerinin tüm depo düzeyindeki sorunları çözmede çok iyi olduğunu iddia ediyor. Ancak tablolarında utançla GLM-5 ve Opus 4.5 ile karşılaştırıyorlar, 5.1 ve 4.6 ile değil.

Claude Code ile depo çalışması için kendi kıyaslamalarını (NL2Repo) alıp yakın zamanda çıkan GLM-5.1'in sonuçlarını yanına koyarsak şunu görürüz:
▫️ Claude Opus 4.6 — 47.9
▫️ GLM-5.1 — 45.3
▫️ Qwen3.6-Plus — 37.9

Eski kodla uğraşmak ve büyük yeniden düzenlemeler için GLM-5.1 çok daha tercih edilir.

👍 İşe yarar bir şey: API'ye preserve_thinking parametresi eklendi.

Diğerlerinde şu anda nasıl çalışıyor: klasik ajan döngüsünde model her adımda reasoning (düşüncelerini) üretir, bunları ya atarız ya da geri besleriz, tonlarca token harcarız.
preserve_thinking=True ile API, diyaloğun önceki tüm adımlarından gelen akıl yürütme bağlamını otomatik olarak korur. Bu, maliyeti önemli ölçüde azaltır ve uzun, çok adımlı görevlerde ajanın "şizofrenisini" önler. Varsayılan olarak parametre kapalıdır, istekte extra_body aracılığıyla iletilir. Kendi ajanlarınızı yapıyorsanız not alın.

Ayrıca OpenClaw ile entegrasyon, Qwen Code CLI aracı ve Anthropic API formatı için yerel destek yayınladılar. Yani, Claude Code'da doğrudan onların uç noktasını kullanabilir ve terminalden çalışabilirsiniz. Ayrıca varsayılan 1M token bağlam penceresi.

Kısacası, Çinlilerden API geliştiricileri için harika özelliklere sahip bir başka sağlam çok modlu model, ancak "vay be" etkisi yok.

Sohbette de deneyebilirsiniz. 💬