Класи слів із взаємної інформації
У грудні 1992 року п'ятеро дослідників IBM на чолі з Пітером Брауном описали в Computational Linguistics, як розкласти словник із 260 741 слова на 1 000 класів лише за тим, які слова стоять поруч у майже 366 мільйонах слів тексту, і будувати мовну модель на класах замість окремих слів.
Чому це важливо
Схожість слів вивели із самого тексту, без словника й розмітки, і класи вийшли водночас граматичними й змістовими. Нейронна мовна модель Бенжіо 2003 року виходить саме з цієї ідеї, замінює дискретний клас слова неперервним вектором і порівнює себе з класовими моделями.
Алгоритм жадібний: спершу кожне слово — окремий клас, далі зливається та пара класів, що найменше зменшує середню взаємну інформацію сусідніх класів; для великого словника слова додаються в порядку частоти. Перплексія корпусу Brown (1 014 312 слів, не входив до навчання): словесна триграмна модель — 244, класова — 271, суміш обох — 236. Класи зменшують частку невидимих триграмів із 14,7 % до 3,8 %. Та сама стаття знаходить «липкі» пари слів і змістові класи за співвживанням на відстані. Чого запис не стверджує. Виграш у перплексії невеликий: класова модель сама по собі гірша за словесну, допомагає лише їхня суміш.