Netflix Merilis VOID: Inpainting yang Memahami Hubungan Sebab-Akibat 🍿
Inpainting biasa pada video bekerja seperti ini: pilih orang, jaringan menutupi pikselnya dengan latar belakang. Hasilnya buram, ya sudahlah. Tapi jika orang itu memegang gitar atau bersandar di meja, gitarnya akan tetap menggantung di udara, dan taplak meja akan mempertahankan bentuk siku yang tidak ada.
Peneliti dari Netflix bersama INSAIT merilis model VOID (Video Object and Interaction Deletion). Alat ini tidak sekadar menutupi piksel latar belakang, tetapi menghapus objek beserta semua interaksi fisiknya di dalam adegan.
Hapus orang yang memegang gitar — gitar jatuh secara realistis ke lantai.
Hilangkan penyangga — benda menggelinding dari meja.
Bagaimana cara kerjanya:
Dasarnya adalah
CogVideoX dari Zhipu AI. Semua keajaiban di sini tidak terletak pada arsitektur yang terlalu rumit, melainkan pada pipeline persiapan data dan conditioning yang cerdik.1️⃣ Quadmask (mask 4 nilai)
Alih-alih mask biner klasik (hapus/pertahankan), jaringan diberi mask dengan empat nilai:
0 (hitam) — objek yang akan dihapus.127 (abu-abu) — affected region (zona interaksi di mana proses fisik akan berubah, misalnya lintasan jatuh).63 (abu-abu gelap) — overlay.255 (putih) — latar belakang statis yang tidak disentuh.Mask ini pada preprocessing secara otomatis dikumpulkan oleh kombinasi
SAM2 dan Gemini (VLM-Mask-Reasoner).2️⃣ Dataset kontrafaktual
Model tidak mensimulasikan fisika secara real-time. Untuk mengajarkan fisika ke model difusi, para insinyur menghasilkan dataset video berpasangan di Blender (berdasarkan data mocap HUMOTO) dan Kubric. Dalam satu video objek ada, di video kedua objek tidak ada, dan mesin menghitung fisika jatuhnya elemen lainnya. Model hanya mempelajari prior fisika ini.
3️⃣ Inferensi 2-Pass
Pass pertama menghapus objek secara dasar. Tapi kita tahu bahwa model difusi video suka berkedip. Karena itu ada
Pass 2: ia menggunakan aliran optik untuk menghasilkan warped noise di ruang laten. Ini secara kaku memperbaiki konsistensi temporal.Untuk menjalankan pipeline ini, Anda memerlukan GPU dengan VRAM minimal 40GB (A100). Transformer difusi pada video memakan memori dengan sangat boros. Untungnya, dalam kode sudah tersedia CPU-offload dan kuantisasi FP8, sehingga Anda bisa mencoba memasukkannya ke perangkat yang lebih sederhana jika Anda punya banyak waktu menunggu tensor dari RAM.
Kode, bobot (dalam format safetensors) dan notebook demo sudah tersedia.
#opensource_keren
Komentar
0Belum ada komentar.
Masuk untuk ikut berdiskusi.