VQA: запитання до зображення
3 травня 2015 року Станіслав Антол, Деві Парікх і співавтори запропонували задачу відкритих відповідей на запитання про зображення й набір для неї. У першій версії — 123 285 зображень MS COCO, 215 150 запитань і 430 920 відповідей, а також 10 000 абстрактних сцен із 30 000 запитань.
Чому це важливо
Розуміння зображення стало вимірюваним: відповідь із кількох слів можна автоматично звірити з людськими, тоді як підпис оцінювати важко. Задача вимагає впізнавання, лічби й здорового глузду разом.
Набір на момент подання був неповним: відповіді зібрано лише для 50 000 реальних зображень. Є два варіанти — відкрита відповідь і вибір із переліку. Випадкова відповідь дає менше 0,5 %, відповідь «так» на все — 16,29 %, а на запитаннях «так/ні» — 56,43 %; усі базові моделі гірші за людей. Запис не стверджує поширених чисел 0,25 млн зображень, 0,76 млн запитань і 10 млн відповідей, а також десяти відповідей на запитання: у першій версії їх немає.