
⚡️ El modelo de IA Qwen 3.5-Omni escribe código a partir de videoguías
Alibaba lanzó Qwen 3.5-Omni, una nueva versión de la LLM multimodal. La red neuronal puede procesar simultáneamente datos textuales, gráficos, de audio y video.
La principal diferencia de Qwen 3.5-Omni son 256 mil tokens de ventana de contexto. Gracias a esto, la IA puede procesar de una sola vez más de 10 horas de audio o aproximadamente 400 segundos de video en resolución 720p. El reconocimiento de voz abarca 113 idiomas y dialectos.
El modelo fue entrenado con más de 100 millones de horas de datos de audio y video.
El modelo «mira» una grabación de pantalla con instrucciones de audio y escribe código funcional basado en estos datos sin indicaciones textuales.
⁉️ Esta capacidad surgió por casualidad sin entrenamiento)
Descárgalo aquí
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.