Згладжування Кнезера — Нея
На ICASSP-95 у Детройті (9–12 травня 1995 року) Райнгард Кнезер із дослідницьких лабораторій Philips в Ахені й Германн Ней з Ахена запропонували для n-грамної мовної моделі розподіли відступу, оптимізовані саме для випадків, коли довшої послідовності в даних не було. Перплексія знизилася приблизно на 10 %, частка помилок слів у розпізнаванні мовлення — на 5 %.
Чому це важливо
N-грамні мовні моделі розпізнавання мовлення й перекладу дістали спосіб оцінювати небачене, який згодом виявився найкращим серед порівняних. У поясненні Чена й Гудмана 1998 року ймовірність слова на нижчому рівні має залежати не від того, як часто слово трапляється, а від того, після скількох різних слів воно стоїть.
Відступ (backing-off) — перехід до коротшої історії, коли довшого n-грама в навчальних даних немає. Кнезер і Ней двома шляхами вивели розподіли для цього переходу, які, за резюме, досить сильно відрізняються від звичайних. Приклад Чена й Гудмана: слово Francisco часте, але трапляється лише після San, тож після незнайомого слова воно малоймовірне, хоча загалом трапляється часто. Чого запис не стверджує. Повного тексту статті не прочитано: IEEE Xplore дає лише резюме, тож числа 10 % і 5 % — звідти, а на яких корпусах їх виміряно, запис не знає. Механізм «скільки різних попередніх слів» описано словами Чена й Гудмана, а не самої статті.