WordNet: словник, складений за значеннями
У грудні 1990 року прінстонська група Джорджа Міллера опублікувала WordNet — базу англійської лексики, побудовану не за абеткою, а за значеннями. Одиниця бази — синсет, множина слів, що виражають одне поняття; іменники розкладено на 25 незалежних ієрархій.
Чому це важливо
Дотепер комп'ютер, що зустрів слово, мав від словника лише написання й тлумачення для людини. WordNet дав машині відстань між поняттями: можна спитати, що спільного в двох слів, і дістати відповідь із самої структури. На цьому потім стояло зняття багатозначності, а через п'ятнадцять років — прив'язка витягнутих із вебу фактів до чогось, що має форму.
Автори: Джордж Міллер, Річард Беквіт, Крістіана Фельбаум, Дерек Ґросс і Кетрін Міллер. Стаття відкриває тематичний випуск International Journal of Lexicography 3(4), сторінки 235—244. Роботу почато, як каже сам текст, 1985 року. Лексику розділено на чотири частини мови — іменники, дієслова, прикметники, прислівники. Службові слова не входять навмисно: текст припускає, що вони зберігаються окремо, як частина синтаксису. Іменники не зводяться в одне дерево: їх розбито на двадцять п'ять незалежних ієрархій, кожну з власним коренем, бо спільна вершина була б семантично порожньою. Іменники зв'язано гіпонімією й меронімією, дієслова — тропонімією. Чого запис не стверджує. Він не називає обсягу бази на 1990 рік. Копія п'яти статей, яку Прінстон роздає досі, позначена «Revised August 1993», і числа в ній — 95 600 словоформ і 70 100 значень — це стан 1993 року, а не 1990-го; ставити їх під цю дату було б помилкою. Не стверджується й те, що початкових класів двадцять шість: у таблиці їх двадцять п'ять, і текст двічі каже це словом.