Повернутися до часової лінії

Дослідження · вересень 1990 р.

Латентний семантичний аналіз

У вересні 1990 року Скотт Дірвестер, Сьюзен Дюмей, Джордж Фурнас, Томас Ландауер і Річард Гаршман описали в JASIS пошук документів через сингулярний розклад матриці «термін — документ»: терміни й документи дістають вектори з близько ста факторів, а запит порівнюється з ними за косинусом. На медичній колекції MED точність зросла на 13 % проти прямого збігу слів.

Чому це важливо

Слово й документ уперше подано точками в просторі, виведеному з того, які слова трапляються в тих самих текстах: документ знаходився й тоді, коли не містив жодного слова із запиту. Нейронна мовна модель Бенжіо 2003 року і word2vec 2013 року називають цей метод попередником своїх векторів слів.

Автори — з Bell Communications Research (Дюмей, Фурнас, Ландауер), Чиказького університету (Дірвестер) і Університету Західного Онтаріо (Гаршман). MED — 1 033 анотації медичних статей і 30 запитів, 5 823 терміни; середня точність 0,51 проти 0,45 у простого збігу термінів. Точність зростала від 10 до 100 факторів і була найкращою на 100. CISI — 1 460 анотацій з інформатики і 35 запитів: 0,11 і в методу, і в збігу термінів, а система SMART зі стемінгом дала 0,14. Автори самі застерігають, що MED зібрано з результатів пошуку за ключовими словами, тож вона може давати надто добрі результати. Чого запис не стверджує. Числа взято з авторського машинопису статті, а не з журнальної верстки, яка стоїть за пейволом; день виходу номера невідомий. У тексті статті метод названо латентним семантичним індексуванням (LSI); слово «аналіз» стоїть лише в заголовку.

Відомості про подію

Дата події
вересень 1990 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 26 вересня 2026 р.
Лінії
ID
evt-0840

Випуск Journal of the American Society for Information Science, том 41, номер 6, вересень 1990 року, за записом Crossref; дня виходу джерела не дають.

Джерела

Пов’язані події