Повернутися до часової лінії

Дослідження · 1998

Баєсівський фільтр небажаної пошти

1998 року Мехран Сахамі зі Стенфорда та Сьюзен Дюмейс, Девід Геккерман і Ерік Горвіц з Microsoft Research показали, що наївний баєсівський класифікатор, навчений на листах користувача, відсіює небажану пошту. На 1789 листах із простими ознаками поштового домену він досяг 100 % точності й 98,3 % повноти для небажаних.

Чому це важливо

Фільтр небажаної пошти стало можливо навчити на власній пошті, а не писати правилами вручну, і навмисно зсунути поріг так, щоб легітимний лист майже ніколи не губився. Автори доводили, що технологія готова до розгортання.

Корпус: 1789 листів, з них 1578 небажаних і 211 легітимних, поділених у часі на 1538 навчальних і 251 тестовий. Лист вважається небажаним, лише якщо ймовірність понад 99,9 %. Таблиця 1, точність і повнота для небажаних: самі слова — 97,1 і 94,3 %, зі словами й близько 35 фразами — 97,6 і 94,3 %, з 20 нетекстовими ознаками поштового домену — 100,0 і 98,3 %. У реальному сценарії, навченому на 2593 листах за рік, фільтр за тиждень із 222 листів, 45 з яких були небажаними, відсіяв 80 % небажаних і помилково позначив 3 легітимні, один із них — переслану кимось небажану пошту. Поділ небажаних на порнографічні й інші погіршив результат.

Відомості про подію

Дата події
1998
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 24 вересня 2026 р.
Лінії
ID
evt-0695

Технічний звіт AAAI WS-98-05, 1998; місяця й місця воркшопу прочитаний документ не називає.

Джерела

Записи, що посилаються на цей