MusicLM: музика з текстового опису
26 січня 2023 року Андреа Агостінеллі й співавтори з Google описали MusicLM — модель, що генерує музику з опису на кшталт «спокійна скрипкова мелодія на тлі спотвореної гітари»: 24 кГц, узгоджено на кілька хвилин. Мелодію можна й наспівати чи насвистати, і модель виконає її в описаному стилі.
Чому це важливо
Текст став способом керувати музикою так, як раніше зображеннями. Разом зі статтею Google відкрив MusicCaps, перший оцінювальний набір, зібраний саме для генерації музики з тексту, а саму модель не випустив.
MusicLM спирається на AudioLM і на спільний простір музики й тексту MuLan; навчання — п'ять мільйонів кліпів, 280 тисяч годин музики. MusicCaps — 5 521 пара «музика — опис», написаних музикантами. Перевірка на меморизацію знайшла точні збіги в мізерній частці прикладів і приблизні — в 1 %; автори написали, що «наразі не планують випускати моделі».