Доступність · 20 січня 2025 р.
DeepSeek-R1
Китайська лабораторія відкрила модель, що міркує на рівні o1, і показала, що така поведінка виникає з чистого підкріпленого навчання за правильну відповідь.
Чому це важливо
Міркування перестало бути закритою технологією однієї компанії: рецепт виявився коротким, а ваги — у відкритому доступі.
Ключовим був не результат, а спосіб. Базову модель навчали підкріпленням на задачах із перевірною відповіддю, без жодного людського прикладу міркування — і модель сама виробила довгі ланцюги з самоперевіркою і поверненнями. Звіт описував момент, коли модель під час навчання зупиняється й переписує підхід. На відміну від o1, ланцюг показували повністю. Ваги виклали під ліцензією MIT, і за тижні на них виросли десятки менших моделей.
Відомості про подію
- Дата події
- 20 січня 2025 р.
- Дата на часовій лінії
- Дата події
- Перевірка
- Джерела зібрано автоматично · 18 вересня 2026 р.
- Лінії
- ID
- evt-0318
Ваги й технічний звіт оприлюднено 20 січня 2025 року.
Записи, що посилаються на цей
- Пов’язано Мінус 17 відсотків за день
Ринок відреагував на модель, випущену за тиждень до того.
- Пов’язано Qwen3
Друга китайська лабораторія за квартал, що віддала передові ваги у відкритий доступ.
- Пов’язано gpt-oss
Відповідь на рік, у якому відкриті ваги стали сильним аргументом у чужих руках.
- Пов’язано США відкривають продаж H200 до Китаю
Обмеження вводили проти лабораторій, які однаково вийшли на передовий рубіж.
- Розвиває DeepSeek-V4
Четверте покоління тієї самої лінії, через п'ятнадцять місяців після моделі, що міркує.
DeepSeek-V4 Preview Release - Уможливлює GRPO: навчання з підкріпленням без критика
GRPO, описаний тут, — це алгоритм, яким через рік навчено DeepSeek-R1.
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning - Протиставляє Тисяча прикладів і примусовий бюджет
Таблиця статті ставить s1-32B поруч із дистиляціями R1, навченими на 800 тисячах прикладів проти тисячі тут.
s1: Simple test-time scaling (arXiv:2501.19393v1) - Пов’язано Довгий контекст усередині навчання з підкріпленням
Два дні по тому, як вийшов DeepSeek-R1, інша лабораторія описала свій шлях до того самого — довгий контекст у самому навчанні з підкріпленням.
- Пов’язано Пошук усередині ланцюжка міркування
Роботу побудовано навколо того, чого бракує моделям, які довго міркують: під час самого міркування вони впираються у прогалини у знаннях.
- Спирається на П'ять тисяч головоломок замість корпусу
Перше речення резюме статті починається зі слів «натхнені успіхом DeepSeek-R1»; робота відтворює його рецепт на керованому корпусі.
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning (arXiv:2502.14768v1)