Повернутися до часової лінії

Дослідження · серпень 1988 р.

Навчання за часовими різницями

Саттон показав, що передбачення можна виправляти не за кінцевим результатом, а за наступним передбаченням, і довів, що це працює.

Чому це важливо

Агент перестав чекати кінця епізоду: він учиться з кожного кроку, а не з фіналу.

Стаття формалізує сімейство методів TD(λ), де λ керує тим, наскільки далеко назад поширюється виправлення. Саттон доводить збіжність для лінійного випадку і показує, що TD швидший за метод Монте-Карло на задачах із марковською структурою. Це ядро, на якому через чотири роки побудували TD-Gammon, а через тридцять — глибоке навчання з підкріпленням.

Відомості про подію

Дата події
серпень 1988 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0157

Випуск Machine Learning, том 3, серпень 1988 року.

Джерела

Пов’язані події

Записи, що посилаються на цей