Повернутися до часової лінії

Дослідження · 17 листопада 2014 р.

Show and Tell: підпис до зображення

17 листопада 2014 року Оріоль Віньялс і співавтори з Google описали мережу, яка сама складає речення про зміст зображення: згорткова мережа кодує картинку, рекурентна LSTM пише опис. На наборі Pascal BLEU — 59 проти попереднього найкращого 25 і людських близько 69.

Чому це важливо

Опис зображення звівся до однієї моделі, навченої кінець у кінець на парах «зображення — речення», так само як переклад звівся до пари «речення — речення». Звідси починається лінія моделей, що поєднують зір і мову.

За першою версією препринта, BLEU на Flickr30k зріс із 55 до 66, на SBU — з 19 до 27. Навчальна частина MSCOCO — 82 783 зображення. Запис не стверджує числа 27,7 на COCO: у першій версії його немає.

Відомості про подію

Дата події
17 листопада 2014 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0768

День подання першої версії препринта; числа прочитано в ній.

Джерела

Пов’язані події

Записи, що посилаються на цей