Порівняння згладжувань Чена й Гудмана
У серпні 1998 року Стенлі Чен і Джошуа Гудман випустили в Гарварді технічний звіт, що порівняв основні способи згладжування n-грамних мовних моделей на корпусах Brown, North American Business news, Switchboard і Broadcast News за різних обсягів навчальних даних. Запропонований ними модифікований варіант Кнезера — Нея виграв усі порівняння.
Чому це важливо
Вибір згладжування перестав бути справою звички: звіт показав, від чого залежить перевага кожного методу, і дав один, що вигравав скрізь. N-грами з модифікованим згладжуванням Кнезера — Нея стали тим рівнем, з яким порівнювала себе нейронна мовна модель Бенжіо 2003 року.
Порівнювали методи Єлінека — Мерсера, Каца, Белла — Клірі — Віттена, Нея — Ессена — Кнезера і Кнезера — Нея за крос-ентропією тестового тексту. Модифікація: замість однієї знижки для всіх ненульових лічильників — три, для n-грамів, що трапилися один раз, двічі і три й більше разів. На розпізнаванні мовлення Broadcast News кожен біт крос-ентропії відповідав приблизно 5,4 % абсолютної частки помилок слів, а різниця між найкращим і посереднім згладжуванням, 0,2 біта й більше, — близько 1 %. Чого запис не стверджує. Бенжіо цитує журнальну версію цієї роботи 1999 року в Computer Speech and Language, а не звіт 1998-го; запис датовано звітом, бо прочитано саме його.