Jukebox: пісні зі співом як сирий звук
30 квітня 2020 року Прафулла Дгарівал і співавтори з OpenAI описали Jukebox — модель, що генерує музику зі співом одразу як звукову хвилю: багаторівневий VQ-VAE стискає звук у дискретні коди, а трансформери їх моделюють. Генерацію можна скеровувати виконавцем, жанром і текстом пісні.
Чому це важливо
Генерація музики вийшла за межі нот і MIDI: модель видає цілісні пісні на кілька хвилин із голосом, і ваги з кодом викладено відкрито. Модель навчено на записах, а не на партитурах.
Навчальний набір — 1,2 млн пісень, із них 600 тисяч англійською, з текстами й метаданими з LyricWiki. Генерація повільна: близько години на хвилину верхнього рівня кодів і ще близько восьми годин на розгортання цієї хвилини до звуку. Запис не стверджує поширеного «дев'ять годин на хвилину» як числа статті: вона наводить дві частини окремо.