Репозиторій машинного навчання UCI
1987 року аспірант Каліфорнійського університету в Ірвайні Девід Аха відкрив FTP-архів наборів даних для перевірки алгоритмів машинного навчання. На 4 грудня 1995 року в ньому було 111 наборів даних і теорій предметних галузей загальним обсягом 36 мегабайтів.
Чому це важливо
Машинне навчання дістало спільний полігон: алгоритм можна було перевірити на тих самих даних, що й чужий, і повторити чужий експеримент. 2001 року Брейман порівнював випадкові ліси з AdaBoost на тринадцяти наборах звідси.
Кожен набір — записи з пар «атрибут — значення», по одному на рядок, і окремий файл документації. Доступ — анонімним FTP, через веб і поштою через архівний сервер для тих, хто не мав FTP. Більшість наборів передали дослідники поза Ірвайном; три онкологічні бази з Любляни можна було отримати лише на запит. README 1995 року просив зазначати репозиторій у подяках, щоб інші могли дістати ті самі дані й повторити досліди; головна сторінка у травні 1997 року казала про понад сто записів. Рік 1987 підтверджує документ 1990 року: у дисертації Аха, датованій 27 листопада 1990 року, його резюме називає його організатором репозиторію баз даних машинного навчання UCI у 1987–1990 роках. Чого запис не стверджує. Документа 1987 року не знайдено, тож місяця запис не знає. Скільки наборів було на початку, невідомо.