Повернутися до часової лінії

Дослідження · 30 квітня 2020 р.

Jukebox: пісні зі співом як сирий звук

30 квітня 2020 року Прафулла Дгарівал і співавтори з OpenAI описали Jukebox — модель, що генерує музику зі співом одразу як звукову хвилю: багаторівневий VQ-VAE стискає звук у дискретні коди, а трансформери їх моделюють. Генерацію можна скеровувати виконавцем, жанром і текстом пісні.

Чому це важливо

Генерація музики вийшла за межі нот і MIDI: модель видає цілісні пісні на кілька хвилин із голосом, і ваги з кодом викладено відкрито. Модель навчено на записах, а не на партитурах.

Навчальний набір — 1,2 млн пісень, із них 600 тисяч англійською, з текстами й метаданими з LyricWiki. Генерація повільна: близько години на хвилину верхнього рівня кодів і ще близько восьми годин на розгортання цієї хвилини до звуку. Запис не стверджує поширеного «дев'ять годин на хвилину» як числа статті: вона наводить дві частини окремо.

Відомості про подію

Дата події
30 квітня 2020 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0773

День подання першої версії препринта; числа прочитано в ній.

Джерела

Пов’язані події

Записи, що посилаються на цей