Баєсівський фільтр небажаної пошти
1998 року Мехран Сахамі зі Стенфорда та Сьюзен Дюмейс, Девід Геккерман і Ерік Горвіц з Microsoft Research показали, що наївний баєсівський класифікатор, навчений на листах користувача, відсіює небажану пошту. На 1789 листах із простими ознаками поштового домену він досяг 100 % точності й 98,3 % повноти для небажаних.
Чому це важливо
Фільтр небажаної пошти стало можливо навчити на власній пошті, а не писати правилами вручну, і навмисно зсунути поріг так, щоб легітимний лист майже ніколи не губився. Автори доводили, що технологія готова до розгортання.
Корпус: 1789 листів, з них 1578 небажаних і 211 легітимних, поділених у часі на 1538 навчальних і 251 тестовий. Лист вважається небажаним, лише якщо ймовірність понад 99,9 %. Таблиця 1, точність і повнота для небажаних: самі слова — 97,1 і 94,3 %, зі словами й близько 35 фразами — 97,6 і 94,3 %, з 20 нетекстовими ознаками поштового домену — 100,0 і 98,3 %. У реальному сценарії, навченому на 2593 листах за рік, фільтр за тиждень із 222 листів, 45 з яких були небажаними, відсіяв 80 % небажаних і помилково позначив 3 легітимні, один із них — переслану кимось небажану пошту. Поділ небажаних на порнографічні й інші погіршив результат.