Atlas: одна модель на кілька задач про простір
1 вересня 2026 року World Labs представила Atlas — модель, навчену з нуля на тексті, зображеннях, відео й 3D, що з кількох знімків дає нові ракурси, відео до хвилини у 1440p і тривимірну реконструкцію; доступ — ранній, для відібраних партнерів.
Чому це важливо
Компанія стверджує, що одна модель розв’язує і породження, і реконструкцію сцен, а не окремі спеціалізовані. Редакційна оцінка: усі числа — власні виміри World Labs, без статті, картки моделі й коду, тож перевірити їх ззовні не можна.
За дописом, Atlas — мультимодальний авторегресивний дифузійний трансформер (rectified flow); кожне зображення й карта глибини прив’язані до пози камери й до положення в просторі, і з цього складається «просторовий контекст». Заявлено: відео до 1 хвилини у 1440p з одного–шести зображень із заданим шляхом камери; відновлення сцени з одного–кількох десятків знімків, а вірне відтворення — «вже з двох-трьох»; вихід у вигляді зображень, відео, хмар точок і гаусових сплатів, тієї ж подачі, що в Marble; перегляд відео з трьох–п’яти телефонних камер; демонстрація для робототехніки (два середовища з 24 кадрів кожне). Виміри, як їх подано. Дотримання шляху камери оцінювали сторонні люди-оцінювачі: Atlas обирали в 75–94 відсотках спроб проти п’яти відеомоделей, яким шлях описували словами. Похибка реконструкції (AbsRel ×10⁻³, менше — краще) на семи наборах: Atlas у середньому 25,3, п’ять базових моделей — від 28,7 до 47,7; компанія каже, що відтворила результати всіх базових моделей сама. На одному наборі, Tanks and Temples, одна з базових має меншу похибку (40,2 проти 42,4). Чого запис не стверджує. Жодного виміру, зробленого не World Labs. Галузеве видання того ж дня пише, що допису не супроводжують ні стаття, ні запис в arXiv, ні картка моделі, ні код. Слова Фей-Фей Лі, що Atlas «по суті розв’язав» розріджену реконструкцію, — її формулювання; допис каже обережніше, «великий крок». Фраза про те, що Atlas живитиме майбутні Marble, — намір.