Netflix lançou VOID: Inpainting que entende relações de causa e efeito 🍿
O inpainting comum em vídeos funciona assim: você seleciona uma pessoa, a rede preenche seus pixels com o fundo. Fica borrado, mas tudo bem. Mas se a pessoa estava segurando um violão ou apoiada em uma mesa, o violão continua flutuando no ar e a toalha mantém a forma de um cotovelo inexistente.
Pesquisadores da Netflix em colaboração com INSAIT publicaram o modelo VOID (Video Object and Interaction Deletion). Essa ferramenta não apenas preenche pixels de fundo, ela remove o objeto junto com todas as suas interações físicas na cena.
Removeu uma pessoa segurando um violão — o violão cai realisticamente no chão.
Removeu um suporte — o objeto rola para fora da mesa.
Como funciona:
A base é
CogVideoX da Zhipu AI. Toda a mágica aqui não está em complicar a arquitetura, mas no pipeline de preparação de dados e no conditioning inteligente.1️⃣ Quadmask (máscara de 4 valores)
Em vez da máscara binária clássica (remover/manter), a rede recebe uma máscara com quatro valores:
0 (preto) — o próprio objeto a ser removido.127 (cinza) — região afetada (zona de interação onde processos físicos mudarão, por exemplo, trajetória de queda).63 (cinza escuro) — overlay.255 (branco) — fundo estático, que não é tocado.Essa máscara é montada automaticamente no pré-processamento por uma combinação de
SAM2 e Gemini (VLM-Mask-Reasoner).2️⃣ Dataset contrafactual
O modelo não simula física em tempo real. Para ensinar física à difusão, os engenheiros geraram um dataset de vídeos pareados no Blender (com base em dados mocap do HUMOTO) e Kubric. Em um vídeo o objeto está presente, no segundo o objeto não está, e o motor calcula a física da queda dos outros elementos. O modelo simplesmente aprendeu esse prior físico.
3️⃣ Inferência em 2 passos
O primeiro passo remove o objeto basicamente. Mas sabemos que difusões de vídeo adoram cintilar. Por isso existe o
Passo 2: ele usa fluxo óptico para gerar warped noise no espaço latente. Isso fixa rigidamente a consistência temporal.Para executar esse pipeline, você precisará de uma GPU com pelo menos 40GB de VRAM (A100). Transformers de difusão em vídeo consomem memória descontroladamente. Felizmente, o código já vem com CPU-offload e quantização FP8, então você pode tentar encaixar em hardware mais simples, se tiver bastante tempo para esperar tensores da RAM.
Código, pesos (no formato safetensors) e notebook demo já estão abertos.
#opensource_legal
Comentários
0Ainda não há comentários.
Entre para participar da conversa.