Повернутися до часової лінії

Дослідження · травень 1989 р.

Q-навчання

Воткінс описав алгоритм, що вчить цінність дії у стані напряму з досвіду, не потребуючи моделі середовища.

Чому це важливо

Агент навчився оптимальної поведінки, не знаючи правил світу і не маючи вчителя, — лише за наслідками власних дій.

Ключова властивість — незалежність від стратегії: агент може діяти як завгодно, а вчити оптимальну поведінку. Воткінс подав і начерк доведення збіжності, повністю доведеної з Даяном 1992 року. Простота алгоритму зробила його стандартним входом у навчання з підкріпленням, а 2013 року глибока версія DQN дала перші результати на іграх Atari.

Відомості про подію

Дата події
травень 1989 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0160

Дисертацію подано до Кембриджського університету в травні 1989 року.

Джерела

Пов’язані події

Записи, що посилаються на цей