BERT
BERT представив двонапрямлене попереднє навчання.
Чому це важливо
Ця робота закріпила відтворюваний рецепт двонапрямленого попереднього навчання для мовних задач.
Наведені бенчмарки залежать від моделі й задач оцінювання зі статті.
Дослідження · 11 жовтня 2018 р.
BERT представив двонапрямлене попереднє навчання.
Ця робота закріпила відтворюваний рецепт двонапрямленого попереднього навчання для мовних задач.
Наведені бенчмарки залежать від моделі й задач оцінювання зі статті.
arXiv · Опубліковано 11 жовтня 2018 р.
BERT використовує двоспрямований Transformer-encoder, прямо описаний у статті.
BERTІнша ставка на тому самому механізмі: породження замість двонаправленого кодування.
Improving Language Understanding by Generative Pre-TrainingСамонавчання маскуванням узято з підходу, показаного на тексті.
Зведений бал на дев'яти завданнях був тим числом, яким через півроку міряли попередньо навчені моделі. Жодне з джерел цього запису причинності не стверджує.
Модель бере ті самі налаштування трансформера, що й BERT, і міряється з ним завдання за завданням.
ERNIE 2.0: A Continual Pre-training Framework for Language Understanding (arXiv:1907.12412v1)