⚡️ El modelo de IA Qwen 3.5-Omni escribe código a partir de videoguías

Alibaba lanzó Qwen 3.5-Omni, una nueva versión de la LLM multimodal. La red neuronal puede procesar simultáneamente datos textuales, gráficos, de audio y video.

La principal diferencia de Qwen 3.5-Omni son 256 mil tokens de ventana de contexto. Gracias a esto, la IA puede procesar de una sola vez más de 10 horas de audio o aproximadamente 400 segundos de video en resolución 720p. El reconocimiento de voz abarca 113 idiomas y dialectos.
El modelo fue entrenado con más de 100 millones de horas de datos de audio y video.

El modelo «mira» una grabación de pantalla con instrucciones de audio y escribe código funcional basado en estos datos sin indicaciones textuales.

⁉️ Esta capacidad surgió por casualidad sin entrenamiento)

Descárgalo aquí