Статистичне розмічування частин мови
На конференції ANLP в Остіні в лютому 1988 року Кеннет Черч із Bell Laboratories показав програму, що розставляє частини мови в довільному тексті, перемножуючи дві ймовірності, оцінені на розміченому корпусі Brown з близько мільйона слів: чи буває слово цією частиною мови і чи йде вона після двох попередніх. Точність — 95–99 % залежно від того, що вважати правильним.
Чому це важливо
Розмічування частин мови, яке досі покладали на граматичні правила, звелося до підрахунків у корпусі й динамічного програмування за лінійний час. Програма Черча PARTS дала початкову автоматичну розмітку Penn Treebank, яку анотатори потім виправляли.
Лексична ймовірність — частка випадків, коли слово в корпусі Brown має цю частину мови (I — займенник у 5 837 випадках із 5 838); контекстна — частота трійки тегів, поділена на частоту пари. Черч оцінює невизначеність: близько 0,25 біта на тег, коли відоме слово, і близько 2 бітів, коли відомі лише два сусідні теги. Зразок на 400 слів оцінено як правильний на 99,5 %. Той самий підхід знаходив прості групи іменника; їхні ймовірності оцінено на 40 000 словах (11 000 груп). Чого запис не стверджує. Черч не перший застосував n-грами до розмічування: стаття сама називає досліди Мерсера в IBM 1982 року і ланкастерську групу, що розмітила корпус LOB з успіхом 96,7 %, і каже, що розвивалася незалежно від неї. Число 95–99 % — оцінка автора, а не вимір на відкладеній вибірці.