R-CNN: згорткова мережа знаходить об'єкти
11 листопада 2013 року Росс Гіршик, Джітендра Малік і співавтори з Берклі показали, що мережа, навчена класифікувати цілі зображення ImageNet, може знаходити об'єкти: вона оцінює близько 2 000 регіонів-пропозицій, і на PASCAL VOC 2007 середня точність сягає 48 %.
Чому це важливо
Детекцію об'єктів перевели з ручних ознак на ознаки згорткової мережі, перенесені з класифікації, — з приростом понад 40 % відносно деформовних моделей частин. Звідси почалася лінія детекторів, у якій наступні роботи міряли себе проти R-CNN.
Схема: пропозиції регіонів знизу вгору (selective search), для кожного — ознаки великої згорткової мережі, потім лінійні SVM за класами. На PASCAL VOC 2010 — 43,5 % mAP проти 35,1 % у методу з тими самими регіонами й мішком візуальних слів і 29,6 % у деформовних моделей частин. Запис не стверджує 53,3 % на VOC 2012 і результату на ILSVRC2013: цих чисел у першій версії немає, вони з'явилися в пізніших.