Dropout
3 липня 2012 року Джеффрі Гінтон, Нітіш Шрівастава, Алекс Крижевський, Ілля Суцкевер і Руслан Салахутдінов з Торонтського університету виклали препринт: на кожному навчальному прикладі вимикати кожен прихований нейрон з імовірністю 0,5, а під час перевірки вдвічі зменшувати вихідні ваги. На MNIST найкраща звичайна мережа робила 160 помилок; dropout знизив їх приблизно до 130, а з вимиканням ще й 20 % пікселів входу — приблизно до 110. Одна мережа на ImageNet 2010 — з 48,6 % до 42,4 % похибки.
Чому це важливо
Велику мережу на обмежених даних стало можливо вберегти від перенавчання, не навчаючи багатьох окремих моделей: dropout навчає експоненційну кількість проріджених мереж зі спільними вагами й дешево усереднює їх під час перевірки. Стаття AlexNet тієї ж осені застосувала його в перших двох повнозв'язних шарах і написала, що без нього мережа суттєво перенавчається.
Препринт повідомляє рекорди в мовленні й розпізнаванні об'єктів. TIMIT, класифікація кадрів: похибка з 22,7 % до 19,7 % — рекорд для методів, що не використовують відомостей про мовця. CIFAR-10: найкращий опублікований результат без перетворених даних — 18,5 %, їхня згорткова мережа — 16,6 %, з dropout в останньому прихованому шарі — 15,6 %. ImageNet 2010: переможець змагання — 47,2 %, найкращий на той час — 45,7 %, їхня одна мережа — 48,6 %, з 50 % dropout у шостому прихованому шарі — 42,4 %. Замість штрафу L2 автори обмежують норму вхідних ваг кожного нейрона. Дві дати: препринт 3 липня 2012 року й стаття в JMLR (подано в листопаді 2013, опубліковано в червні 2014).