Речення жестової мови з відео
Магістерська робота Теда Старнера в MIT Media Lab (лютий 1995 року, керівник — Алекс Пентленд) описала систему прихованих марковських моделей, що в реальному часі розпізнає речення американської жестової мови з відео однієї камери; словник — 40 слів. У листопаді на ISCV у Корал-Гейблз вони повідомили про 99,2 % точності слів.
Чому це важливо
Метод, що зробив практичним розпізнавання мовлення, перенесли на мову, яку бачать, а не чують: машина читала з відео не окремі жести, а цілі речення. Послідовність рухів руки виявилася придатною до тієї самої моделі, що й послідовність звуків.
У дисертації (подано 20 січня 1995 року) руки в кольорових рукавичках — жовтій на правій і помаранчевій на лівій — відстежує одна камера з частотою 5 кадрів за секунду; 494 випадкові речення з п'яти слів (займенник, дієслово, іменник, прикметник, займенник) поділено на 395 навчальних і 99 тестових; розпізнавання вп'ятеро швидше за реальний час на HP 735. На незалежному тесті — 97,0 % слів із граматикою і 95,0 % без неї, тобто 90,7 % точності з урахуванням вставок. Резюме доповіді ISCV дає 99,2 % без моделювання пальців, але умов не називає, а її повного тексту не прочитано. Розширену версію надруковано в IEEE PAMI у грудні 1998 року (Старнер, Вівер, Пентленд): руки без рукавичок, той самий словник 40 слів; камера на столі — 92 %, камера в кепці користувача — 98 %, або 97 % без обмеження граматики. Запис не стверджує поширених 91,3 % без граматики: у дисертації — 91 % (90,7 %).