Повернутися до часової лінії

Дослідження · 13–16 жовтня 2003 р.

Візуальні слова: відео шукають як текст

У жовтні 2003 року на ICCV Йосеф Сівіч і Ендрю Ціссерман з Оксфорда перенесли в зображення устрій текстового пошуку. Дескриптори ділянок кадру згруповано у «візуальні слова», найчастіші й найрідші відкинуто стоп-списком, кадри зважено за tf-idf і занесено в інвертований файл. Пошук обведеного об’єкта серед 4 тисяч ключових кадрів фільму тривав близько 0,1 секунди.

Чому це важливо

Зіставлення зображень перестало бути перебором пар дескрипторів: збіги пораховано заздалегідь, як слова в документах, і об’єкт знаходиться в цілому фільмі відразу. «Мішок візуальних слів» став звичним описом зображення в розпізнаванні до згорткових мереж: R-CNN 2013 року ще порівнюватиме себе з таким підходом.

Proceedings of the Ninth IEEE International Conference on Computer Vision, т. 2, с. 1470–1477. Два типи афінно-інваріантних ділянок, у середньому близько 1000 на кадр, відстежено між сусідніми кадрами, і 10 % найнестабільніших треків відкинуто. Словник вивчено методом k-середніх на 48 планах фільму «Біжи, Лоло, біжи» — близько 10 тисяч кадрів і 200 тисяч усереднених дескрипторів: близько 6 тисяч слів для одного типу ділянок і 10 тисяч для другого. Стоп-список прибирає 5 % найчастіших і 10 % найрідших слів. Той самий словник без змін шукав об’єкти в «Дні бабака». Запит — на Matlab на процесорі Pentium 2 ГГц.

Відомості про подію

Дата події
13 жовтня 2003 р. – 16 жовтня 2003 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
ID
evt-0816

Дні ICCV 2003 у Ніцці за Crossref.

Джерела

Пов’язані події

Записи, що посилаються на цей