Mengapa AI Diajari untuk Mensimulasikan Dunia
Odyssey memperkenalkan Odyssey-2 Max, model dunia terbesar mereka. Secara formal, ini adalah kerabat dari generator video, tetapi logikanya berbeda: sistem tidak mengumpulkan video jadi berdasarkan prompt, tetapi langkah demi langkah memprediksi keadaan adegan berikutnya dan memungkinkan untuk melanjutkan simulasi secara real-time.
Perusahaan tidak menjual "video cantik", tetapi lingkungan yang dapat dikendalikan, di mana masa depan bingkai bergantung pada keadaan sebelumnya dan tindakan pengguna. Untuk game, ini terdengar seperti adegan interaktif. Untuk robotika, seperti lingkungan pelatihan. Untuk pertahanan dan kedokteran, ini menjadi alasan untuk mencermati kualitas verifikasi, karena fisika yang indah dalam demo belum berarti model hubungan sebab-akibat yang andal.
Rilis ini menyertakan beberapa angka spesifik. 2 Max kira-kira 3 kali lebih besar dari 2 Pro dan dilatih dengan peningkatan komputasi 10 kali lipat. Pada bagian fisika VBench 2, skor meningkat dari 49,67 menjadi 58,52. Pada PAI-Bench Physics, dari 91,67 menjadi 93,02. Perusahaan juga mengklaim bahwa semua simulasi yang ditunjukkan berjalan secara real-time dan dapat berlangsung lebih dari 120 detik.
Secara teknis, model ini dibangun sebagai transformer difusi autoregresif. Detail penting: konteks panjang, perhatian kausal, kontrol tindakan melalui representasi laten, pencocokan aliran dalam ruang laten kontinu, dan pengurangan jumlah langkah denoising. Pelatihan dilakukan pada beberapa ratus NVIDIA B200.
Bagian yang paling menarik di sini bukanlah gambarnya. Pencipta membuat analogi dengan model bahasa: prediksi token berikutnya memberi sistem kemampuan untuk meniru penalaran, dan prediksi keadaan dunia berikutnya seharusnya memberikan intuisi fisik. Ini adalah hipotesis ambisius, dan ini menjelaskan dengan baik mengapa ada begitu banyak minat investor dan peneliti pada model dunia saat ini.
Tapi semua ini perlu diuji dengan hati-hati. VBench dan PAI-Bench mengevaluasi konsistensi video yang dihasilkan, bukan kesesuaian sistem untuk robotika nyata atau pemodelan ilmiah. Latar belakang yang stabil, gerakan halus, dan mekanika yang masuk akal berguna, tetapi mereka tidak membuktikan bahwa model memahami hubungan sebab-akibat dalam arti yang ketat.
Perbandingan dengan Sora, Veo, Kling, dan Runway juga diatur menguntungkan bagi pengembang 2 Max. Sistem-sistem ini dikecualikan dari tabel sebagai model video dua arah, karena mereka tidak dirancang untuk prediksi interaktif keadaan masa depan. Argumennya logis, tetapi bidang perbandingan menjadi lebih kecil: ini tentang kategori yang perusahaan itu sendiri coba tetapkan sebagai kategori terpisah.
Poin lainnya: model tersedia dalam beta pribadi untuk mitra. Artinya, verifikasi independen masih terbatas. Pertanyaan utama akan muncul dalam skenario panjang, di mana pengguna melakukan tindakan aneh, adegan secara bertahap mengakumulasi kesalahan, dan kewajaran fisik mulai bertentangan dengan kemampuan kontrol.
Rilis ini tetap signifikan. Video generatif secara bertahap terbagi menjadi dua jalur: produksi konten visual jadi dan simulator lingkungan interaktif. Jalur pertama melayani media. Jalur kedua dapat menjadi dasar untuk simulator, game, agen, robotika, dan sistem perencanaan.
Perlombaan untuk model dunia telah menjadi arah yang terpisah. Yang bersaing bukanlah keindahan bingkai, melainkan stabilitas kausalitas, cakrawala simulasi, kemampuan kontrol, dan biaya generasi real-time.
❗️❗️❗️❗️❗️❗️❗️❗️ / Tidak dilarang di RF
Komentar
0Belum ada komentar.
Masuk untuk ikut berdiskusi.