Максимальна ентропія в обробці мови
У березні 1996 року Адам Бергер, Стівен і Вінсент Делла П'єтра описали в Computational Linguistics, як будувати ймовірнісну модель мови за принципом максимальної ентропії: з усіх розподілів, що узгоджуються з обраними фактами про дані, брати найрівномірніший, а самі факти (ознаки) добирати автоматично.
Чому це важливо
Будь-які ознаки контексту — сусідні слова, їхні форми, позицію — стало можливо поєднувати в одній моделі без припущень про їхню незалежність. Умовні випадкові поля 2001 року виросли саме з обмеження таких локальних моделей.
Роботу виконано в IBM T. J. Watson Research Center за підтримки ARPA; на час публікації Бергер працював у Колумбійському університеті, Делла П'єтри — у Renaissance Technologies. Параметри оцінює алгоритм Improved Iterative Scaling, версія ітеративного масштабування Дарроха й Реткліффа 1972 року; ознаки додаються жадібно, за приростом правдоподібності. Приклади — зі статистичного перекладача IBM Candide (з французької на англійську) на канадському корпусі Hansard із 3,6 млн пар речень: переклад слова in залежно від контексту, поділ французького речення на відрізки до 10 слів, які можна перекладати послідовно, і перестановка у фразах NOUN de NOUN. У перестановці модель із 358 обмежень, навчена на 10 000 прикладах, була правою у 80,4 % із 71 555 тестових фраз проти 70,2 % у правила «ніколи не переставляти». Чого запис не стверджує. Сам принцип і алгоритм масштабування старші за статтю; нове в ній — автоматичний добір ознак і застосування до мови.