⚡️ KI-Modell Qwen 3.5-Omni schreibt Code nach Videoanleitungen

Alibaba hat Qwen 3.5-Omni veröffentlicht – eine neue Version des multimodalen LLM. Das neuronale Netz kann gleichzeitig Text-, Grafik-, Audio- und Videodaten verarbeiten.

Der Hauptunterschied von Qwen 3.5-Omni sind 256.000 Token im Kontextfenster. Dadurch kann die KI mehr als 10 Stunden Audio oder etwa 400 Sekunden Video in 720p-Auflösung auf einmal verarbeiten. Die Spracherkennung umfasst 113 Sprachen und Dialekte.
Das Modell wurde mit über 100 Millionen Stunden Audio- und Videodaten trainiert.

Das Modell „sieht“ sich eine Bildschirmaufnahme mit Audioanweisungen an und schreibt anhand dieser Daten funktionierenden Code ohne Textvorgaben.

⁉️ Diese Fähigkeit entstand zufällig ohne Training)

Abholen hier