Show and Tell: підпис до зображення
17 листопада 2014 року Оріоль Віньялс і співавтори з Google описали мережу, яка сама складає речення про зміст зображення: згорткова мережа кодує картинку, рекурентна LSTM пише опис. На наборі Pascal BLEU — 59 проти попереднього найкращого 25 і людських близько 69.
Чому це важливо
Опис зображення звівся до однієї моделі, навченої кінець у кінець на парах «зображення — речення», так само як переклад звівся до пари «речення — речення». Звідси починається лінія моделей, що поєднують зір і мову.
За першою версією препринта, BLEU на Flickr30k зріс із 55 до 66, на SBU — з 19 до 27. Навчальна частина MSCOCO — 82 783 зображення. Запис не стверджує числа 27,7 на COCO: у першій версії його немає.