Повернутися до часової лінії

Дослідження · 7–12 липня 1997 р.

Лексикалізований статистичний синтаксичний аналіз

На спільній конференції ACL і EACL у Мадриді (7–12 липня 1997 року) Майкл Коллінз із Пенсильванського університету описав три генеративні моделі лексикалізованої контекстно-вільної граматики. На розділі 23 Wall Street Journal у Penn Treebank найкраща дала 88,1 % точності й 87,5 % повноти складників.

Чому це важливо

Статистичний аналізатор, навчений лише на деревах Penn Treebank, наблизився до 90 % правильних складників і водночас почав відновлювати субкатегоризацію й переміщення wh-слів, потрібні, щоб витягти з дерева, хто що зробив. Виміряно на тому самому розбитті, що й попередників, тож поступ видно в числах: у Мейджермана 1995 року було 84,3 і 84,0 %.

Навчання — розділи 02–21 Wall Street Journal у Penn Treebank (близько 40 000 речень), тест — розділ 23 (2 416 речень), міри PARSEVAL. На всіх реченнях до 100 слів модель 2 має точність 88,1 % і повноту 87,5 %; попередня модель Коллінза 1996 року — 85,7 і 85,3; модель Мейджермана 1995 року — 84,3 і 84,0. На реченнях до 40 слів (2 245) модель 2 дає 88,6 і 88,1. Модель 3 знаходить сліди переміщення з точністю 93,3 % і повнотою 90,1 % на 436 випадках. Кожен складник має головне слово, від якого залежать імовірності його частин. Чого запис не стверджує. Числа 88,1 і 87,5 легко переставити: у статті 88,1 — точність, 87,5 — повнота. Лексикалізовану генеративну модель будував і Шарняк 1995 року, і Коллінз його цитує, тож модель не єдина свого роду.

Відомості про подію

Дата події
7 липня 1997 р. – 12 липня 1997 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 26 вересня 2026 р.
Лінії
ID
evt-0846

35-та конференція ACL разом із 8-ю конференцією EACL, Мадрид: місяць дає ACL Anthology, дні 7–12 липня 1997 року — Crossref.

Джерела

Пов’язані події