Повернутися до часової лінії

Дослідження · лютий 2003 р.

Слова й зображення: спільна модель

У лютому 2003 року Journal of Machine Learning Research надрукував «Matching Words and Pictures» Барнарда, Дуйґулу, Форсайта, де Фрейтаса, Блея й Джордана. Кілька моделей спільного розподілу слів і областей зображення передбачали підписи до цілого зображення й називали окремі області; дані — зображення зі 160 дисків Corel по 100 на кожному.

Чому це важливо

Автоанотацію й називання областей виміряли на однакових даних для цілого сімейства моделей — ієрархічної аспектної, перекладної та мультимодального розширення LDA. Зображення стали документом зі словами, який можна моделювати тими самими засобами, що й текст.

Із 160 дисків Corel брали вибірки по 80: 75 % на навчання, 25 % на відкладений набір, а решта дисків давала складніший «новий» набір. Ознаки областей квантували в 500 кластерів; словник — близько 155 слів залежно від тестового набору. Типовий приріст 0,160 у нормалізованій оцінці автори пояснюють так: близько 80 % слів досягається приблизно за 40 спроб проти 70 для емпіричного розподілу. Перекладну модель узято з машинного перекладу Брауна та ін. Запис не стверджує числа «16 000 зображень»: у тексті є 160 дисків по 100 зображень, а суму не названо.

Відомості про подію

Дата події
лютий 2003 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0800

Місяць випуску за JMLR («Published 2/03»); статтю подано у квітні 2002 року.

Джерела

Пов’язані події