Sora
OpenAI показала модель, що породжує хвилинні відео з текстового опису, зі стійкими об'єктами й послідовним рухом камери.
Чому це важливо
Породження відео перейшло межу, за якою результат перестав миттєво видавати себе як машинний.
Модель працює як дифузійний трансформер: відео ріжеться на просторово-часові латки, і трансформер поступово прибирає з них шум. Тривалість до хвилини на порядок перевищувала попередні системи. OpenAI не відкрила модель одразу, давши доступ лише художникам і фахівцям з безпеки, і прямо назвала ризик правдоподібних підробок. Публічний випуск відбувся аж наприкінці року.