Informedia: пошук у відео за сказаним
Цифрова відеобібліотека Informedia в Карнеґі-Меллон, розпочата 1994 року за Digital Library Initiative (NSF, DARPA, NASA), транскрибувала звук відео розпізнавачем Sphinx і шукала сюжети за словами транскрипту. На травень 1998 року вона мала понад 1 000 годин новин і 400 годин документального відео; підсумок надруковано в IEEE Computer у лютому 1999-го.
Чому це важливо
Мовлення, зображення й текст разом описували відео так, щоб його можна було шукати за змістом, а не за назвою касети. Стаття виміряла головне: пошук лишався корисним і тоді, коли розпізнавач помилявся майже в кожному третьому слові.
За статтею 1999 року, у перших дослідах на новинах 1994 року частка хибних слів Sphinx становила 65 %; Sphinx III, навчений на 66 годинах новин, дав близько 24 %, а мовна модель, змішана з «новинами дня» із сайтів CNN, Reuters і AP, — 19 %. При частці хибних слів до 30 % точність і повнота пошуку падали менш ніж на 10 %. Бібліотека мала понад 40 000 сегментів, читала титри з кадру й шукала зображення за кольором і областями. У вересні 1995 року D-Lib Magazine описав застосунок News-on-Demand: запити голосом, Sphinx-II на окремій машині, близько 600 МБ на годину відео MPEG-I. Запис не стверджує дати першої публікації проєкту, а його початок подає за статтею з виміром: інша стаття керівника проєкту називає 1995 рік.