Netflix a dévoilé VOID : Inpainting qui comprend les relations de cause à effet 🍿

L'inpainting classique dans les vidéos fonctionne ainsi : on sélectionne une personne, le réseau masque ses pixels avec ceux de l'arrière-plan. Résultat flou, et tant pis. Mais si la personne tenait une guitare ou s'appuyait sur une table, la guitare reste suspendue dans les airs et la nappe conserve la forme d'un coude inexistant.

Les chercheurs de Netflix, en collaboration avec INSAIT, ont publié le modèle VOID (Video Object and Interaction Deletion). Cet outil ne se contente pas de masquer les pixels de l'arrière-plan, il supprime l'objet ainsi que toutes ses interactions physiques dans la scène.

On supprime une personne qui tenait une guitare — la guitare tombe réalistement au sol.
On enlève un support — l'objet roule de la table.

Comment ça marche :
La base est CogVideoX de Zhipu AI. Toute la magie réside non pas dans une architecture trop complexe, mais dans le pipeline de préparation des données et un conditionnement astucieux.

1️⃣ Quadmask (masque à 4 valeurs)
Au lieu du masque binaire classique (supprimer/conserver), on alimente le réseau avec un masque de quatre valeurs :
0 (noir) — l'objet à supprimer.
127 (gris) — région affectée (zone d'interaction où les processus physiques changent, par exemple la trajectoire de chute).
63 (gris foncé) — superposition.
255 (blanc) — arrière-plan statique que l'on ne touche pas.
Ce masque est automatiquement assemblé en prétraitement par une combinaison de SAM2 et Gemini (VLM-Mask-Reasoner).

2️⃣ Dataset contrefactuel
Le modèle ne simule pas la physique en temps réel. Pour apprendre la physique à la diffusion, les ingénieurs ont généré un dataset de vidéos appariées dans Blender (basé sur les données mocap HUMOTO) et Kubric. Dans une vidéo, l'objet est présent ; dans l'autre, l'objet est absent, et le moteur calcule la physique de chute des autres éléments. Le modèle a simplement appris cet a priori physique.

3️⃣ Inférence en 2 passes
La première passe supprime l'objet de base. Mais on sait que les diffuseurs vidéo adorent scintiller. D'où la Pass 2 : elle utilise le flux optique pour générer un bruit déformé dans l'espace latent. Cela fixe rigidement la cohérence temporelle.

Pour exécuter ce pipeline, vous aurez besoin d'un GPU d'au moins 40 Go de VRAM (A100). Les transformeurs de diffusion vidéo consomment énormément de mémoire. Heureusement, le code intègre nativement le CPU-offload et la quantification FP8, donc on peut essayer de le faire tenir sur du matériel plus modeste, si vous avez beaucoup de temps pour attendre les tenseurs depuis la RAM.

Code, poids (au format safetensors) et notebook de démo sont déjà ouverts.

#bon_open_source