Музичний жанр, розпізнаний за звуком
У липні 2002 року Джордж Цанетакіс і Перрі Кук із Принстонського університету опублікували в IEEE Transactions on Speech and Audio Processing систему, що відносить музичний запис до жанру за ознаками тембру, ритму й висоти. На наборі з десяти жанрів по сто 30-секундних уривків вона вгадувала 61 %, коли випадковий вибір дав би 10 %.
Чому це важливо
Жанр — людська мітка без чітких меж — уперше виміряли як задачу машинного розпізнавання зі спільним набором і числом точності. Ці десять жанрів по сто уривків під назвою GTZAN стали найуживанішим відкритим набором для розпізнавання жанру: огляд 2013 року знайшов його щонайменше в ста роботах — і заразом повтори, хибні мітки та спотворення, яких майже ніхто не помічав.
Для кожного з 20 музичних і трьох мовленнєвих жанрів зібрано по 100 уривків по 30 секунд — близько 19 годин із радіо, компакт-дисків і MP3, у моно 22 050 Гц. Набір із десяти жанрів: класика, кантрі, диско, хіп-хоп, джаз, рок, блюз, реггі, поп, метал. Кожен запис описано 30 числами: 19 про тембр, 6 про ритм (гістограма ударів), 5 про висоту; класифікатори — гауссові суміші й k найближчих сусідів. Музику від мовлення система відрізняла в 86 % випадків, три види мовлення — у 74 %. Програмною основою була вільна MARSYAS під ліцензією GNU GPL. Чого запис не стверджує: назви GTZAN у статті немає, і звідки вона, запис не каже; за словами Цанетакіса в тому ж огляді 2013 року, набір не створювали спеціально для розпізнавання жанру. Порівняння з людьми стаття бере з чужого дослідження з іншими жанрами: студенти вгадували 53 % після чверті секунди й 70 % після трьох секунд.