RTFM: світ без 3D-моделі
16 жовтня 2025 року World Labs показала дослідницький перегляд RTFM: модель, що в реальному часі породжує відео сцени, по якій рухається глядач, на одному графічному процесорі H100.
Чому це важливо
Сцена тут існує не як сітка чи гаусові сплати, а як пам’ять нейромережі про кадри з позами: «рендерер» став навчуваним. Редакційна оцінка: це заява розробника про власну систему, а не виміряний результат.
За дописом компанії, RTFM — авторегресивний дифузійний трансформер над послідовностями кадрів, навчений наскрізно на великих відеоданих передбачати наступний кадр. Вхідні кадри стають активаціями (KV-кешем), що неявно тримають світ; явного 3D-подання немає. Кожен кадр має позу в просторі, тому пам’ять має просторову структуру, а «context juggling» добирає для нового кадру найближчі. Компанія заявляє інтерактивну частоту кадрів на одному H100 і «стійкість» світу. Сама ж наводить арифметику: наївний інтерактивний потік 4K на 60 кадрах за секунду потребує понад 100 тисяч токенів за секунду, а година стійкості — контексту понад 100 мільйонів токенів. Чого запис не стверджує. Допис не називає числа параметрів, не подає жодного порівняння чи виміру стійкості, а динамічні світи й взаємодію з ними лише обіцяє як подальший крок. Галузеве видання того ж дня переказує допис і випробування не повідомляє. Дата — день допису; один переказ із пошуку називав 17 жовтня, але його не відкривали.