Повернутися до часової лінії

Дослідження · грудень 1992 р.

Класи слів із взаємної інформації

У грудні 1992 року п'ятеро дослідників IBM на чолі з Пітером Брауном описали в Computational Linguistics, як розкласти словник із 260 741 слова на 1 000 класів лише за тим, які слова стоять поруч у майже 366 мільйонах слів тексту, і будувати мовну модель на класах замість окремих слів.

Чому це важливо

Схожість слів вивели із самого тексту, без словника й розмітки, і класи вийшли водночас граматичними й змістовими. Нейронна мовна модель Бенжіо 2003 року виходить саме з цієї ідеї, замінює дискретний клас слова неперервним вектором і порівнює себе з класовими моделями.

Алгоритм жадібний: спершу кожне слово — окремий клас, далі зливається та пара класів, що найменше зменшує середню взаємну інформацію сусідніх класів; для великого словника слова додаються в порядку частоти. Перплексія корпусу Brown (1 014 312 слів, не входив до навчання): словесна триграмна модель — 244, класова — 271, суміш обох — 236. Класи зменшують частку невидимих триграмів із 14,7 % до 3,8 %. Та сама стаття знаходить «липкі» пари слів і змістові класи за співвживанням на відстані. Чого запис не стверджує. Виграш у перплексії невеликий: класова модель сама по собі гірша за словесну, допомагає лише їхня суміш.

Відомості про подію

Дата події
грудень 1992 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 26 вересня 2026 р.
Лінії
ID
evt-0842

Computational Linguistics, том 18, номер 4, грудень 1992 року.

Джерела

Пов’язані події