Випадкові ліси
У журналі Machine Learning (том 45, випуск 1, жовтень 2001, с. 5–32) Лео Брейман з Каліфорнійського університету в Берклі визначив випадкові ліси: ансамбль дерев, кожне з яких вирощено за незалежно вибраним випадковим вектором, і дерева голосують за клас. Він довів, що похибка узагальнення лісу майже напевно збігається до межі зі зростанням кількості дерев, обмежив її силою окремих дерев і кореляцією між ними й показав, що випадковий вибір ознак у кожному вузлі дає похибку, порівнянну з AdaBoost або меншу, і стійкість до шуму.
Чому це важливо
Ансамбль дерев дістав теорію того, коли додавання дерев перестає допомагати і чому, разом з оцінками похибки, сили, кореляції й важливості кожної змінної, обчисленими з самих навчальних даних. Класифікатор частин тіла Kinect 2011 року — випадковий ліс дерев рішень, і його стаття цитує цю роботу.
Брейман ставить метод після бегінгу (власна робота 1996 року) і випадкового вибору розщеплень Діттеріха (1998). Порівняння з AdaBoost зроблено на 20 наборах даних: 13 менших з репозиторію UCI, 3 більших з окремими навчальною й перевірною частинами і 4 синтетичних. Повний текст прочитано у звіті Бреймана, датованому січнем 2001 року, на його сторінці в Берклі: резюме звіту дослівно збігається з резюме на сторінці журналу, але числа тіла — це числа звіту, з журнальним набором вони не звірені. Дата журналу, жовтень 2001, — зі сторінки Springer і реєстру Crossref. Чого запис не стверджує: конкретних похибок із таблиць (не переписано) і того, що випадкові ліси стали промисловим стандартом, — жодне прочитане джерело цього не каже.