Повернутися до часової лінії

Дослідження · 29 квітня 2002 р.

Розпізнавання об'єктів як переклад

У томі ECCV 2002, опублікованому 29 квітня 2002 року, Пінар Дуйґулу, Кобус Барнард, Нандо де Фрейтас і Девід Форсайт з Берклі й UBC подали розпізнавання як переклад: області зображення — слова однієї мови, ключові слова — іншої. На 4 500 зображеннях Corel із 371 словом EM навчив словник між 500 типами областей і словами.

Чому це важливо

Зображення й текст навчали разом як вирівняний двомовний корпус — тим самим методом, яким статистичний переклад учив словники з паралельних текстів. Машина вчилася називати частини зображення лише з підписів до цілих зображень, без розмітки областей: цю задачу потім розв'язували моделі підписів і CLIP.

Зображення сегментували Normalized Cuts на 5–10 областей, кожну описували 33 ознаками й квантували k-середніми у 500 «блобів»; кожне зображення мало 4–5 ключових слів. Модель — model 2 Брауна та ін. Із 371 слова вдалося передбачати лише 80; на 500 відкладених зображеннях для кращих слів повнота сягала 0,83 (sky), точність — 1,00 (petals). Слова, яких ознаки не розрізняють (train і locomotive), об'єднували в кластери. Сторінка Барнарда називає нагороду ECVision за найкращу статтю з когнітивного комп'ютерного зору. Авторська копія не має текстового шару; числа прочитано з відрендерених сторінок.

Відомості про подію

Дата події
29 квітня 2002 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0799

День публікації тому LNCS 2353 за Springer; дат самої конференції в Копенгагені в прочитаних джерелах немає.

Джерела

Пов’язані події

Записи, що посилаються на цей