
⚡️ KI-Modell Qwen 3.5-Omni schreibt Code nach Videoanleitungen
Alibaba hat Qwen 3.5-Omni veröffentlicht – eine neue Version des multimodalen LLM. Das neuronale Netz kann gleichzeitig Text-, Grafik-, Audio- und Videodaten verarbeiten.
Der Hauptunterschied von Qwen 3.5-Omni sind 256.000 Token im Kontextfenster. Dadurch kann die KI mehr als 10 Stunden Audio oder etwa 400 Sekunden Video in 720p-Auflösung auf einmal verarbeiten. Die Spracherkennung umfasst 113 Sprachen und Dialekte.
Das Modell wurde mit über 100 Millionen Stunden Audio- und Videodaten trainiert.
Das Modell „sieht“ sich eine Bildschirmaufnahme mit Audioanweisungen an und schreibt anhand dieser Daten funktionierenden Code ohne Textvorgaben.
⁉️ Diese Fähigkeit entstand zufällig ohne Training)
Abholen hier
Kommentare
0Noch keine Kommentare.