⚡️ Model AI Qwen 3.5-Omni menulis kode berdasarkan panduan video

Alibaba merilis Qwen 3.5-Omni - versi baru dari LLM multimodal. Jaringan saraf ini mampu memproses data teks, grafik, audio, dan video secara bersamaan.

Perbedaan utama Qwen 3.5-Omni adalah 256 ribu token jendela konteks. Berkat ini, AI dapat memproses lebih dari 10 jam audio atau sekitar 400 detik video dalam resolusi 720p sekaligus. Pengenalan suara mencakup 113 bahasa dan dialek.
Model ini dilatih pada lebih dari 100 juta jam data audio dan video.

Model ini "menonton" rekaman layar dengan instruksi audio dan menulis kode yang berfungsi berdasarkan data ini tanpa petunjuk teks.

⁉️ Kemampuan ini muncul secara tidak sengaja tanpa pelatihan)

Ambil di sini