Сірникові коробки, що вчаться грати
У листопаді 1963 року Дональд Мічі описав у The Computer Journal машину MENACE, що вчилася грати в хрестики-нулики спробами й помилками: по сірниковій коробці на кожну з 287 істотно різних позицій, кольорові намистинки в ній — можливі ходи. Після нічиєї в кожну відкриту коробку додавали одну намистинку, після перемоги — три, після поразки одну забирали. Саму машину й перший турнір Мічі описав ще 1961 року.
Чому це важливо
Навчання з підкріпленням стало пристроєм, який можна скласти на столі й перелічити: хід, що вів до виграшу, випадає частіше, хід, що вів до програшу, — рідше. Стаття 1963 року перенесла ту саму схему на комп'ютер Pegasus 2 і зробила з неї експеримент із трьома параметрами, де підкріплення слабшає від кінця партії до її початку.
Симуляція на Pegasus 2, зроблена з Д. Дж. М. Мартіном із Ferranti, грала за обидві сторони приблизно по партії на секунду; коли вчилися обидві, за кілька сотень партій обидві грали майже як експерт. Параметри моделі — A, B і коефіцієнт згасання D; наступна стаття серії мала описати, як від них залежить навчання. Мічі пояснює свою машину термінами експериментальної психології й не цитує жодної роботи, крім власної статті 1961 року. Чого запис не стверджує: кількості партій першого турніру — числа 220 зі звичних переказів у статті немає; належності автора сторінка не називає. Звіт, з якого взято кандидата, писав, що в наукових працях назва машини — «Machine Educable»; сама стаття пише «Matchbox Educable». Сторінку видавця закриває перевірка Cloudflare, тож текст прочитано в копії на сторінці Родні Брукса в MIT, а місяць і сторінки взято з Crossref.