⚡️ Le modèle IA Qwen 3.5-Omni écrit du code à partir de tutoriels vidéo

Alibaba a publié Qwen 3.5-Omni, une nouvelle version du LLM multimodal. Le réseau neuronal peut traiter simultanément des données textuelles, graphiques, audio et vidéo.

La principale différence de Qwen 3.5-Omni est sa fenêtre contextuelle de 256 000 tokens. Grâce à cela, l'IA peut traiter en une seule fois plus de 10 heures d'audio ou environ 400 secondes de vidéo en résolution 720p. La reconnaissance vocale couvre 113 langues et dialectes.
Le modèle a été entraîné sur plus de 100 millions d'heures de données audio et vidéo.

Le modèle « regarde » un enregistrement d'écran avec des instructions audio et écrit un code fonctionnel à partir de ces données sans invites textuelles.

⁉️ Cette capacité est apparue par hasard, sans entraînement)

À récupérer ici