Градієнтний бустинг
У The Annals of Statistics за жовтень 2001 року (том 29, випуск 5, с. 1189–1232) Джером Фрідман зі Стенфорда подав бустинг як градієнтний спуск у просторі функцій: кожен новий складник адитивної моделі підганяється під від'ємний градієнт довільно обраної функції втрат. Він дав алгоритми для найменших квадратів, найменших абсолютних відхилень, втрат Губера й багатокласової логістичної правдоподібності, окремі версії для дерев регресії (TreeBoost) і засоби тлумачення таких моделей. Стаття — лекція Рейтца 1999 року.
Чому це важливо
Бустинг перестав бути прив'язаним до однієї функції втрат. Перезважування прикладів у AdaBoost стало окремим випадком загального рецепта, який працює для регресії й класифікації з будь-яким диференційовним критерієм, і стаття сама пов'язує його з бустингом Фройнда й Шапіре.
Стаття вводить стиснення (shrinkage): кожне оновлення множиться на темп навчання ν між 0 і 1. У симуляції з 5000 навчальних спостережень менші ν дали кращу точність і більшу оптимальну кількість ітерацій, зі спадною віддачею нижче 0,125; автор називає поліпшення зазвичай разючим, а його причину — загадкою, яку ще досліджують. Прочитано з повного PDF на Project Euclid у браузерній панелі, бо оболонці сайт віддає сторінку-скрипт; копії на сайтах Стенфорда не відповіли. Чого запис не стверджує: рекомендованого значення на кшталт ν ≤ 0,1 (очікувалося, у тексті його немає) і застосування методу в Netflix Prize, якого джерело того запису не показує.