«Put-That-There»: голос і жест в одній команді
У липні 1980 року Річард Болт з Architecture Machine Group MIT описав на SIGGRAPH систему, де людина в кріслі перед настінним екраном створює й пересуває фігури, кажучи «put that there» і показуючи рукою. Мовлення розпізнавав NEC DP-100 зі словником до 120 слів, напрям руки — магнітний датчик Polhemus на ремінці годинника.
Чому це важливо
Два канали введення працюють як одне речення: «that» і «there» набувають значення лише від жесту, а жест стає точним завдяки слову. Задачу, яку згодом розв'язували Kinect і мультимодальні помічники, тут поставлено й показано працюючою системою.
За статтею, DP-100 розпізнавав до п'яти слів у реченні без пауз і відповідав приблизно за 300 мс після його кінця; у режимі окремих слів словник сягав близько 1 000. Датчик ROPAMS від Polhemus Navigation Sciences — куб-передавач 1,5 дюйма й куб-датчик 0,75 дюйма в змінному магнітному полі. Media Room — кімната приблизно 16 на 11 футів. Команди: create, move (із синонімами put і place), copy, make that, delete, name. Роботу фінансувала DARPA. Стаття описує систему, а не експеримент: запис не стверджує ні точності розпізнавання, ні виміру того, як людям було нею користуватися.