Повернутися до часової лінії

Доступність · 20 січня 2025 р.

DeepSeek-R1

Китайська лабораторія відкрила модель, що міркує на рівні o1, і показала, що така поведінка виникає з чистого підкріпленого навчання за правильну відповідь.

Чому це важливо

Міркування перестало бути закритою технологією однієї компанії: рецепт виявився коротким, а ваги — у відкритому доступі.

Ключовим був не результат, а спосіб. Базову модель навчали підкріпленням на задачах із перевірною відповіддю, без жодного людського прикладу міркування — і модель сама виробила довгі ланцюги з самоперевіркою і поверненнями. Звіт описував момент, коли модель під час навчання зупиняється й переписує підхід. На відміну від o1, ланцюг показували повністю. Ваги виклали під ліцензією MIT, і за тижні на них виросли десятки менших моделей.

Відомості про подію

Дата події
20 січня 2025 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 18 вересня 2026 р.
Лінії
ID
evt-0318

Ваги й технічний звіт оприлюднено 20 січня 2025 року.

Джерела

Пов’язані події

Записи, що посилаються на цей