Повернутися до часової лінії

Дослідження · червень 2018 р.

GPT-1

OpenAI показала, що трансформер, попередньо навчений передбачати наступне слово на неанотованому тексті, після дообчення б'є спеціалізовані моделі.

Чому це важливо

Схема «навчити на всьому тексті, потім дообучити на задачі» вперше спрацювала для мови — і стала єдиною схемою на наступне десятиліття.

Модель мала 117 мільйонів параметрів і навчалася на корпусі книжок. Ключове не в архітектурі, а в порядку дій: спершу передбачення наступного слова на величезному неанотованому корпусі, потім коротке дообчення під конкретну задачу. Через чотири місяці BERT показав те саме для двонаправленого кодування, і суперечка про те, яка схема краща, тривала до появи GPT-3.

Відомості про подію

Дата події
червень 2018 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0236

Статтю оприлюднено в червні 2018 року.

Джерела

Пов’язані події