Навчання за часовими різницями
Саттон показав, що передбачення можна виправляти не за кінцевим результатом, а за наступним передбаченням, і довів, що це працює.
Чому це важливо
Агент перестав чекати кінця епізоду: він учиться з кожного кроку, а не з фіналу.
Стаття формалізує сімейство методів TD(λ), де λ керує тим, наскільки далеко назад поширюється виправлення. Саттон доводить збіжність для лінійного випадку і показує, що TD швидший за метод Монте-Карло на задачах із марковською структурою. Це ядро, на якому через чотири роки побудували TD-Gammon, а через тридцять — глибоке навчання з підкріпленням.