Q-навчання
Воткінс описав алгоритм, що вчить цінність дії у стані напряму з досвіду, не потребуючи моделі середовища.
Чому це важливо
Агент навчився оптимальної поведінки, не знаючи правил світу і не маючи вчителя, — лише за наслідками власних дій.
Ключова властивість — незалежність від стратегії: агент може діяти як завгодно, а вчити оптимальну поведінку. Воткінс подав і начерк доведення збіжності, повністю доведеної з Даяном 1992 року. Простота алгоритму зробила його стандартним входом у навчання з підкріпленням, а 2013 року глибока версія DQN дала перші результати на іграх Atari.