Повернутися до часової лінії

Дослідження · 31 березня – 3 квітня 1992 р.

Тегер Брілла: правила, яких навчається машина

На третій конференції ANLP у Тренто (31 березня — 3 квітня 1992 року) Ерік Брілл із Пенсильванського університету показав тегер частин мови, що сам знаходить правила виправлення власних помилок. 71 знайдене правило звело частку помилок на тестових 5 % корпусу Brown до 5,1 %.

Чому це важливо

Брілл показав, що розмітка правилами, яких машина навчається з корпусу, досягає точності стохастичних тегерів і лишається списком із кількох десятків правил, які людина може прочитати. Версія того самого тегера з його статті 1994 року розставила частини мови в даних CoNLL-2000.

Початковий тегер дає кожному слову його найчастіший тег у навчальних 90 % корпусу Brown (близько 1,1 млн слів) і помиляється приблизно на 7,9 % слів. Далі на окремих 5 % корпусу система перебирає шаблони виправлень (наприклад, змінити тег a на b, якщо попередній тег — z) і щоразу бере те, що найбільше зменшує кількість помилок. З 71 правила 66 зменшили помилки на тесті, 3 нічого не змінили, 2 погіршили; три різні поділи корпусу дали по 5 %. Власна реалізація алгоритму Черча на тих самих вибірках дала близько 4,5 %. Чого запис не стверджує. Слова transformation у статті 1992 року немає: правила вона називає латками (patches), а назва «навчання на трансформаціях» пізніша. Стаття каже, що тегер працює нарівні зі стохастичними, хоча її власне порівняння з Черчем трохи на його користь.

Відомості про подію

Дата події
31 березня 1992 р. – 3 квітня 1992 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 26 вересня 2026 р.
Лінії
ID
evt-0841

Третя конференція з прикладної обробки природної мови (ANLP), Тренто: місяць дає ACL Anthology, дні 31 березня — 3 квітня 1992 року — Crossref.

Джерела

Пов’язані події