GPT-1
OpenAI показала, що трансформер, попередньо навчений передбачати наступне слово на неанотованому тексті, після дообчення б'є спеціалізовані моделі.
Чому це важливо
Схема «навчити на всьому тексті, потім дообучити на задачі» вперше спрацювала для мови — і стала єдиною схемою на наступне десятиліття.
Модель мала 117 мільйонів параметрів і навчалася на корпусі книжок. Ключове не в архітектурі, а в порядку дій: спершу передбачення наступного слова на величезному неанотованому корпусі, потім коротке дообчення під конкретну задачу. Через чотири місяці BERT показав те саме для двонаправленого кодування, і суперечка про те, яка схема краща, тривала до появи GPT-3.