Слова й зображення: спільна модель
У лютому 2003 року Journal of Machine Learning Research надрукував «Matching Words and Pictures» Барнарда, Дуйґулу, Форсайта, де Фрейтаса, Блея й Джордана. Кілька моделей спільного розподілу слів і областей зображення передбачали підписи до цілого зображення й називали окремі області; дані — зображення зі 160 дисків Corel по 100 на кожному.
Чому це важливо
Автоанотацію й називання областей виміряли на однакових даних для цілого сімейства моделей — ієрархічної аспектної, перекладної та мультимодального розширення LDA. Зображення стали документом зі словами, який можна моделювати тими самими засобами, що й текст.
Із 160 дисків Corel брали вибірки по 80: 75 % на навчання, 25 % на відкладений набір, а решта дисків давала складніший «новий» набір. Ознаки областей квантували в 500 кластерів; словник — близько 155 слів залежно від тестового набору. Типовий приріст 0,160 у нормалізованій оцінці автори пояснюють так: близько 80 % слів досягається приблизно за 40 спроб проти 70 для емпіричного розподілу. Перекладну модель узято з машинного перекладу Брауна та ін. Запис не стверджує числа «16 000 зображень»: у тексті є 160 дисків по 100 зображень, а суму не названо.