Розпізнавання об'єктів як переклад
У томі ECCV 2002, опублікованому 29 квітня 2002 року, Пінар Дуйґулу, Кобус Барнард, Нандо де Фрейтас і Девід Форсайт з Берклі й UBC подали розпізнавання як переклад: області зображення — слова однієї мови, ключові слова — іншої. На 4 500 зображеннях Corel із 371 словом EM навчив словник між 500 типами областей і словами.
Чому це важливо
Зображення й текст навчали разом як вирівняний двомовний корпус — тим самим методом, яким статистичний переклад учив словники з паралельних текстів. Машина вчилася називати частини зображення лише з підписів до цілих зображень, без розмітки областей: цю задачу потім розв'язували моделі підписів і CLIP.
Зображення сегментували Normalized Cuts на 5–10 областей, кожну описували 33 ознаками й квантували k-середніми у 500 «блобів»; кожне зображення мало 4–5 ключових слів. Модель — model 2 Брауна та ін. Із 371 слова вдалося передбачати лише 80; на 500 відкладених зображеннях для кращих слів повнота сягала 0,83 (sky), точність — 1,00 (petals). Слова, яких ознаки не розрізняють (train і locomotive), об'єднували в кластери. Сторінка Барнарда називає нагороду ECVision за найкращу статтю з когнітивного комп'ютерного зору. Авторська копія не має текстового шару; числа прочитано з відрендерених сторінок.