Стартъпът World Labs, основан от „кръстницата на ИИ“ Фей-Фей Ли, представи мултимодалния модел на света Atlas. Системата, която обединява текст, снимки, видео и 3D-данни, позволява да се генерират детайлни триизмерни сцени и кинематографични видеоклипове с резолюция 1440p. Atlas може да реконструира реални помещения въз основа на няколко снимки, направени със смартфон, да генерира интерактивни симулации за обучение на роботи и да моделира движението на камерата от всякакви ъгли. Моделът се позиционира като основа за развитието на „пространствен интелект“.

Atlas може да получи от една до шест изходни снимки и зададена траектория на движение на камерата, след което да създаде видео с продължителност до една минута с разделителна способност 1440p. При това камерата може да се движи под зададени ъгли и по избрана траектория, а моделът доизгражда части от сцената, които не са били видими на изходните кадри.

Моделът също така може да реконструира реални пространства въз основа на малък брой фотографии. Обикновено за това са достатъчни 2–3 изображения, въпреки това Atlas може да работи и с десетки и дори повече от сто снимки. В резултат се създават нови изгледи на сцената, карти на дълбочината, облаци от точки и 3D Gaussian Splats, което е представяне на триизмерната сцена под формата на множество малки „облачета“ в пространството.

World Labs представи Atlas: Нов AI модел генерира интерактивни 3D светове от обикновени снимки

Друго направление е работата с видеото като модел на пространството и времето. Atlas може да възстанови триизмерна сцена въз основа на обикновен видеозапис, а след това да създава кадри от нови ъгли, включително и от такива, които не са били налице в изходния видеозапис. Това позволява, например, да се постигне ефектът „bullet-time“, при който едно събитие може да се разглежда от различни точки чрез преместване на виртуалната камера. За демонстрациите World Labs използва смартфони и екшън камери, а не специално оборудване за триизмерно заснемане.

Приложение в роботиката, гейминга и дигиталния дизайн

Робототехниката е един от приоритетите на компанията. Atlas може не само да възстанови триизмерната среда, но и да моделира това, което сензорите на робота ще видят, докато се движи по зададен маршрут.

Моделът генерира изображения и карти на дълбочината от гледната точка на камерите, монтирани на робота. Освен това Atlas е способен да моделира движението и взаимодействието на обектите, като е възможно да се променя тяхното положение, осветление и други параметри. World Labs нарича този подход Real-to-Sim, тоест пренос на данни от реалния свят в симулация с цел създаване на обучителни и тестови среди за роботи.

От техническа гледна точка Atlas представлява мултимодален авторегресивен дифузионен трансформър. По-просто казано, моделът обединява различни типове данни в един контекст и последователно генерира следните елементи, като едновременно използва механизми, характерни за езиковите и генеративните модели на изображения и видео.

Основната разлика между Atlas и обичайните видеогенератори е пространствената обвързаност на данните: изображенията, дълбочината и положението на камерата се разглеждат като части от една обща триизмерна сцена.

World Labs тества Atlas с две задачи: генериране на видео със зададена траектория на камерата и 3D-реконструкция въз основа на няколко изображения. В първия тест независими оценители сравниха Atlas със съвременни видеомодели и по-често избираха неговия резултат: предимството варираше от 75% до 94% в зависимост от модела. Във втория тест Atlas беше сравнен със специализирани отворени модели по отношение на точността на 3D-реконструкцията и беше отчетена по-малка средна грешка. При това резултатите са публикувани от самата World Labs и все още не са получили независимо потвърждение. Atlas вече се предоставя в рамките на ранен достъп на отделни партньори и в бъдеще ще стане основа на новите версии на Marble, продукта на компанията за създаване на цели 3D-светове.