Shoebox рахує з голосу
1961 року інженер IBM Вільям Дерш показав на пресконференції Shoebox - машину завбільшки зі взуттєву коробку, яка розпізнавала 16 слів: цифри від нуля до дев'яти й шість команд, серед них «plus», «minus», «total» і «subtotal». Дерш промовив «Seven plus three plus six plus nine plus five. Subtotal», машина надрукувала кожну цифру й команду і видала 30. Схема обходилася 31 транзистором, менше ніж двома на слово, тоді як ранішим машинам, за словами IBM, треба було до 200 транзисторів на слово.
Чому це важливо
Розпізнавання мовлення вперше вийшло з лабораторії у вигляді речі, яку возять і показують: не стійка зі схемами, а коробка, що керує звичайною лічильною машиною. І воно вперше було зроблене свідомо не за зразком людського слуху - Дерш брав ознаки, яких вухо не розрізняє, бо вважав копіювання людини непридатним для машини.
Обидва джерела - самі IBM, тож кожне число тут є твердженням виробника про власний виріб, і незалежного виміру немає жодного; через це достовірність записано як середню. Спосіб такий: машина ділила звуки на «машинні голосні» - дзвінкі звуки, що народжуються в горлі, як «a», «o», «m», - і «машинні приголосні», шуми тертя повітря об язик і зуби, як «f», «v», «th»; глухі звуки далі ділилися на слабкі й сильні, щоб відрізнити схожі слова на кшталт «one» і «nine». Оскільки машина трималася ознак, які трапляються лише в людському голосі, сторонній шум приміщення їй майже не заважав. Чого запис не стверджує: дати, точнішої за рік, і того, що Shoebox був першою у світі системою розпізнавання мовлення - так каже заголовок сторінки IBM, але схема Bell Labs 1952 року з виміряною точністю передувала їй на дев'ять років. Звіт, з якого зроблено пакет, наводив фрикативи як «f», «s», «th»; на сторінці стоїть «f», «v», «th».