Керований рекурентний блок (GRU)
3 червня 2014 року Кьонхьон Чо, Йошуа Бенжіо й співавтори з Монреальського університету, Гетеборзького університету й Університету Мену виклали кодувальник–декодувальник на рекурентних мережах: одна мережа стискає фразу у вектор фіксованої довжини, друга розгортає його у фразу іншою мовою. Для нього запропоновано новий прихований блок із вентилем скидання й вентилем оновлення, натхненний LSTM, але значно простіший. Як ознака в фразовій системі перекладу з англійської на французьку він підняв BLEU на тесті з 29,33 до 29,96, а разом із нейронною мовною моделлю й штрафом за слова — до 31,18.
Чому це важливо
Рекурентні мережі дістали керований блок, значно простіший за LSTM: вентиль скидання дозволяє відкинути попередній стан, вентиль оновлення вирішує, скільки з нього перенести далі. Стаття про увагу у вересні 2014 року побудувала свою модель перекладу саме на цьому блоці, а в грудні 2014 року Чон і співавтори, порівнюючи його з LSTM, дали йому назву GRU.
Назви GRU в препринті немає (нуль збігів): блок названо новим типом прихованого блока. Назва з'являється в статті Chung, Gulcehre, Cho і Bengio, arXiv:1412.3555, 11 грудня 2014 року, яка знайшла GRU порівнянним з LSTM на моделюванні музики й мовлення. Кодувальник і декодувальник мали по 1000 прихованих блоків; словники обмежено 15 000 найчастіших слів, що покривають близько 93 % даних. Таблиця 1 першої версії, прочитана з відрендереної сторінки, бо текстовий шар переставляє рядки: базова система — 27,63 BLEU на розробці й 29,33 на тесті, з неперервною мовною моделлю — 28,33 і 29,58, з кодувальником–декодувальником — 28,48 і 29,96, з обома — 28,60 і 30,64, з обома й штрафом за слова — 28,93 і 31,18. Чого запис не стверджує: приросту близько одного пункту BLEU від самої рекурентної мережі — очікувався, а насправді 0,63.