Повернутися до часової лінії

Бенчмарк · 1992

TD-Gammon

Програма Тезауро навчилася грати в нарди на рівні найкращих людей, граючи винятково сама проти себе, без бази партій і без підказок.

Чому це важливо

Поєднання мережі й навчання за часовими різницями дало рівень експерта — перший переконливий доказ, що ця пара працює.

Мережа оцінювала позицію, а метод часових різниць виправляв оцінку за наступним ходом. Після мільйона партій самонавчання програма грала нарівні зі світовою елітою. Більше того, деякі її дебютні ходи суперечили усталеній теорії, і згодом гравці переглянули теорію на її користь. Це той самий рецепт, що через двадцять чотири роки дав AlphaGo.

Відомості про подію

Дата події
1992
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0165

Випуск Machine Learning, том 8, 1992 рік.

Джерела

Пов’язані події

Записи, що посилаються на цей