Netflix lanza VOID: Inpainting que entiende relaciones de causa y efecto 🍿
El inpainting normal en video funciona así: seleccionas a una persona, la red la reemplaza con píxeles de fondo. Queda borroso, pero bueno. Sin embargo, si la persona sostenía una guitarra o se apoyaba en una mesa, la guitarra queda flotando en el aire y el mantel conserva la forma del codo inexistente.
Investigadores de Netflix, en colaboración con INSAIT, publicaron el modelo VOID (Video Object and Interaction Deletion). Esta herramienta no solo reemplaza píxeles de fondo, sino que elimina el objeto junto con todas sus interacciones físicas en la escena.
Eliminas a la persona que sostenía una guitarra: la guitarra cae realísticamente al suelo.
Quitas un soporte: el objeto rueda fuera de la mesa.
Cómo funciona:
La base es
CogVideoX de Zhipu AI. Toda la magia no está en una arquitectura más compleja, sino en el pipeline de preparación de datos y un conditioning ingenioso.1️⃣ Quadmask (máscara de 4 valores)
En lugar de la máscara binaria clásica (eliminar/conservar), la red recibe una máscara con cuatro valores:
0 (negro) — el objeto a eliminar.127 (gris) — región afectada (zona de interacción donde cambian los procesos físicos, por ejemplo, la trayectoria de caída).63 (gris oscuro) — superposición.255 (blanco) — fondo estático que no se toca.Esta máscara se genera automáticamente en el preprocesamiento mediante una combinación de
SAM2 y Gemini (VLM-Mask-Reasoner).2️⃣ Dataset contrafáctico
El modelo no simula física en tiempo real. Para enseñar física a la difusión, los ingenieros generaron un dataset de pares de videos en Blender (basado en datos de mocap HUMOTO) y Kubric. En un video el objeto está presente, en el otro no, y el motor calcula la física de caída de los demás elementos. El modelo simplemente aprendió este prior físico.
3️⃣ Inferencia de 2 pasos
El primer paso elimina el objeto básicamente. Pero sabemos que las difusiones de video tienden a parpadear. Por eso hay un
Pass 2: utiliza flujo óptico para generar ruido deformado (warped noise) en el espacio latente. Esto fija firmemente la consistencia temporal.Para ejecutar este pipeline necesitarás una GPU con al menos 40GB de VRAM (A100). Los transformadores de difusión en video consumen memoria sin piedad. Afortunadamente, el código incluye CPU-offload y cuantización FP8, por lo que se puede intentar ejecutar en hardware más modesto si tienes tiempo para esperar la transferencia de tensores desde la RAM.
Código, pesos (en formato safetensors) y notebook demo ya están disponibles.
#buen_open_source
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.