Вісімдесят мільйонів зображень 32 × 32
У листопаді 2008 року Антоніо Торральба, Роб Фергус і Вільям Фрімен з MIT описали в IEEE PAMI набір із 79 302 017 зображень 32 × 32 пікселі. За вісім місяців сім пошукових систем видали 97 245 098 картинок на запити з 75 846 іменників WordNet; після чистки лишилися зображення для 75 062 слів. Міткою кожного є лише запит, за яким його знайдено.
Чому це важливо
Робота перевіряла, чи може розмір даних замінити складність моделі: найпростіший пошук найближчого сусіда на десятках мільйонів крихітних картинок розпізнавав сцени, а для людей наближався до спеціальних детекторів типу Віоли — Джонса. Шум міток при цьому лишився: CIFAR-10 2009 року позначить вручну невелику частину набору, а ImageNet протиставить йому чисті мітки й повну роздільність.
IEEE Transactions on Pattern Analysis and Machine Intelligence 30(11), с. 1958–1970. Пошукові системи: Altavista, Ask, Flickr, Cydral, Google, Picsearch і Webshots; щонайбільше 3000 зображень на слово; близько 1 % слів не дали нічого. Весь набір займає 760 ГБ на одному диску. Роздільність обрано з психофізики: у кольорі при 32 × 32 люди відносять сцену до однієї з 15 категорій правильно понад ніж у 80 % випадків, у сірих тонах їм потрібно близько 64 × 64. Частка правильних міток падає після сотого зображення на запит і стабілізується близько 44 %. Технічний звіт MIT від 23 квітня 2007 року описував ту саму роботу з іншими числами: 10⁸ зображень і 70 399 іменників. Прочитана копія статті — авторський рукопис без номера тому; запис бере числа з нього.