Латентний семантичний аналіз
У вересні 1990 року Скотт Дірвестер, Сьюзен Дюмей, Джордж Фурнас, Томас Ландауер і Річард Гаршман описали в JASIS пошук документів через сингулярний розклад матриці «термін — документ»: терміни й документи дістають вектори з близько ста факторів, а запит порівнюється з ними за косинусом. На медичній колекції MED точність зросла на 13 % проти прямого збігу слів.
Чому це важливо
Слово й документ уперше подано точками в просторі, виведеному з того, які слова трапляються в тих самих текстах: документ знаходився й тоді, коли не містив жодного слова із запиту. Нейронна мовна модель Бенжіо 2003 року і word2vec 2013 року називають цей метод попередником своїх векторів слів.
Автори — з Bell Communications Research (Дюмей, Фурнас, Ландауер), Чиказького університету (Дірвестер) і Університету Західного Онтаріо (Гаршман). MED — 1 033 анотації медичних статей і 30 запитів, 5 823 терміни; середня точність 0,51 проти 0,45 у простого збігу термінів. Точність зростала від 10 до 100 факторів і була найкращою на 100. CISI — 1 460 анотацій з інформатики і 35 запитів: 0,11 і в методу, і в збігу термінів, а система SMART зі стемінгом дала 0,14. Автори самі застерігають, що MED зібрано з результатів пошуку за ключовими словами, тож вона може давати надто добрі результати. Чого запис не стверджує. Числа взято з авторського машинопису статті, а не з журнальної верстки, яка стоїть за пейволом; день виходу номера невідомий. У тексті статті метод названо латентним семантичним індексуванням (LSI); слово «аналіз» стоїть лише в заголовку.