Yapay Zekaya Dünyayı Simüle Etmeyi Neden Öğretiyorlar
Odyssey, en büyük dünya modeli olan Odyssey-2 Max'i tanıttı. Resmi olarak video üreteçlerinin bir akrabası, ancak mantık farklı: sistem bir istem üzerine hazır bir video oluşturmak yerine, adım adım sahnenin bir sonraki durumunu tahmin ediyor ve gerçek zamanlı simülasyonu sürdürmeye olanak tanıyor.
Şirket "güzel video" değil, karenin geleceğinin önceki duruma ve kullanıcı eylemine bağlı olduğu yönetilebilir bir ortam satıyor. Oyunlar için bu, etkileşimli bir sahne gibi geliyor. Robotik için bir eğitim ortamı gibi. Savunma ve tıp için, dikkatli bir doğrulama kalitesi gerektiren bir neden, çünkü demodaki güzel fizik, henüz güvenilir bir neden-sonuç modeli anlamına gelmiyor.
Sürümde birkaç somut sayı var. 2 Max, 2 Pro'dan yaklaşık 3 kat daha büyük ve 10 kat daha fazla hesaplama ile eğitildi. VBench 2'nin fizik bölümünde sonuç 49,67'den 58,52'ye yükseldi. PAI-Bench Physics'te 91,67'den 93,02'ye. Şirket ayrıca gösterilen tüm simülasyonların gerçek zamanlı çalıştığını ve 120 saniyeden uzun sürebildiğini iddia ediyor.
Teknik olarak model, otoregresif bir difüzyon dönüştürücüsü olarak inşa edilmiştir. Önemli detaylar: uzun bağlam, nedensel dikkat, gizli temsiller aracılığıyla eylem kontrolü, sürekli gizli uzayda akış eşleştirme ve gürültü giderme adımlarının sayısını azaltma. Eğitim birkaç yüz NVIDIA B200 üzerinde gerçekleştirildi.
Buradaki en ilginç kısım resim değil. Yaratıcılar, dil modelleriyle bir benzetme yapıyor: sonraki tokeni tahmin etmek, sistemlere akıl yürütmeyi taklit etme yeteneği kazandırdı ve dünyanın bir sonraki durumunu tahmin etmek fiziksel sezgi kazandırmalı. Bu iddialı bir hipotez ve dünya modellerine neden bu kadar yatırımcı ve araştırma ilgisi olduğunu iyi açıklıyor.
Ancak tüm bunları dikkatlice kontrol etmek gerekiyor. VBench ve PAI-Bench, oluşturulan videonun tutarlılığını değerlendirir, sistemin gerçek robotik veya bilimsel modelleme için uygunluğunu değil. Kararlı bir arka plan, pürüzsüz hareket ve makul mekanikler faydalıdır, ancak modelin katı anlamda nedensel ilişkileri anladığını kanıtlamazlar.
Sora, Veo, Kling ve Runway ile karşılaştırma da 2 Max geliştiricileri için avantajlı bir şekilde düzenlenmiştir. Bu sistemler, etkileşimli gelecek durum tahmini için tasarlanmadıkları için çift yönlü video modelleri olarak tablodan çıkarılmıştır. Argüman mantıklı, ancak karşılaştırma alanı daha küçük: şirketin ayrı bir kategori olarak pekiştirmeye çalıştığı bir kategoriden bahsediyoruz.
Bir diğer nokta: model ortaklar için özel betada mevcut. Bu nedenle bağımsız doğrulama şimdilik sınırlı. Ana sorular, kullanıcının garip eylemler yaptığı, sahnenin yavaş yavaş hata biriktirdiği ve fiziksel makullüğün kontrol edilebilirlikle çatışmaya başladığı uzun senaryolarda ortaya çıkacak.
Sürüm yine de önemli. Üretken video yavaş yavaş iki hatta ayrılıyor: hazır görsel içerik üretimi ve etkileşimli ortam simülatörleri. İlk hat medyaya hizmet ediyor. İkincisi, simülatörler, oyunlar, ajanlar, robotik ve planlama sistemleri için temel olabilir.
Dünya modelleri yarışı ayrı bir yön haline geldi. Burada rekabet eden, karelerin güzelliğinden çok, nedenselliğin sağlamlığı, simülasyon ufku, kontrol edilebilirlik ve gerçek zamanlı üretim maliyetidir.
❗️❗️❗️❗️❗️❗️❗️❗️ / Rusya'da yasaklı değil
Comentários
0Ainda não há comentários.
Entre para participar da conversa.