⚡️ Modelo de IA Qwen 3.5-Omni escreve código a partir de vídeos tutoriais

A Alibaba lançou o Qwen 3.5-Omni - uma nova versão do LLM multimodal. A rede neural é capaz de processar simultaneamente dados textuais, gráficos, de áudio e vídeo.

A principal diferença do Qwen 3.5-Omni são 256 mil tokens de janela de contexto. Graças a isso, a IA pode processar de uma só vez mais de 10 horas de áudio ou aproximadamente 400 segundos de vídeo em resolução 720p. O reconhecimento de fala abrange 113 idiomas e dialetos.
O modelo foi treinado em mais de 100 milhões de horas de dados de áudio e vídeo.

O modelo "assiste" à gravação da tela com instruções de áudio e escreve código funcional a partir desses dados, sem dicas de texto.

⁉️ Essa capacidade surgiu por acaso, sem treinamento)

Pegue aqui aqui