Дослідження · травень 2020 р.
GPT-3
Модель зі 175 мільярдами параметрів виконувала задачі за кількома прикладами в запиті, без жодного дообчення ваг.
Чому це важливо
З'явилася здатність, якої ніхто не програмував: модель навчається з умови задачі, а не з градієнтного кроку.
Стрибок у сто разів проти GPT-2 дав не лише кращу якість, а якісно іншу поведінку. Навчання в контексті означало, що для нової задачі не треба ні даних, ні перенавчання — досить описати її в запиті. Це змінило спосіб користування моделлю: замість дообчення з'явився промпт. Разом із законами масштабування того ж року GPT-3 закріпила напрямок на збільшення.
Відомості про подію
- Дата події
- травень 2020 р.
- Дата на часовій лінії
- Дата події
- Перевірка
- Джерела зібрано автоматично · 17 вересня 2026 р.
- Лінії
- ID
- evt-0238
Препринт від 28 травня 2020 року; доповідь на NeurIPS 2020.
Записи, що посилаються на цей
- Розвиває Codex і Copilot
Та сама модель, дообучена на публічному коді.
OpenAI Codex - Розвиває InstructGPT і навчання на людських оцінках
Та сама модель, навчена виконувати прохання, а не продовжувати текст.
Training language models to follow instructions with human feedback - Пов’язано NVIDIA A100
Залізо, на якому навчали моделі покоління GPT-3.
- Пов’язано LLaMA
Модель на 13 мільярдів параметрів перевершує GPT-3 на 175 мільярдах на більшості вимірів.
- Пов’язано Segment Anything
Той самий хід, що в мові: одна модель, керована запитом, замість моделі під задачу.
- Пов’язано MMLU: 57 предметів, які модель не вчила
Найбільша модель того часу на цьому тесті дала 43,9 % при випадковому вгадуванні 25 % — саме цей розрив і був приводом набір опублікувати.
Measuring Massive Multitask Language Understanding - Уможливлює Обхід вебу стає доступним усім
У таблиці 2.2 статті про GPT-3 відфільтрований Common Crawl дає 410 мільярдів токенів із 499 мільярдів зібраного набору.
Language Models are Few-Shot Learners - Протиставляє «Стохастичні папуги»: чи може мовна модель бути завеликою
Стаття називає цю модель серед тих, чиє нарощування ставить під питання, і запитує, чи достатньо продумано ризики такого масштабування.
On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? - Пов’язано 1287 мегават-годин на GPT-3
Модель, оголошену рік тому, тут уперше названо у мегават-годинах і тоннах.
Carbon Emissions and Large Neural Network Training (arXiv:2104.10350v1) - Пов’язано Низькорангова адаптація (LoRA)
Головний випадок статті — GPT-3 175B: розгортання багатьох окремо донавчених копій, кожна на 175 млрд параметрів, автори називають надзвичайно дорогим.
LoRA: Low-Rank Adaptation of Large Language Models - Пов’язано Підказка з ланцюжком міркувань
Перша версія перевіряє метод і на GPT-3 davinci, результати якого називає порівнянними з моделлю на 137 млрд параметрів.
Chain of Thought Prompting Elicits Reasoning in Large Language Models