Дослідження · 12 червня 2017 р.
Transformer
Transformer застосував увагу без рекурентних шарів.
Чому це важливо
Ця робота замінила рекурентність увагою й зробила обчислення послідовностей більш паралельним.
Стаття описує експерименти з перекладу й синтаксичного аналізу, а не універсальну здатність.
Відомості про подію
- Дата події
- 12 червня 2017 р.
- Дата на часовій лінії
- Дата події
- Перевірка
- Джерела зібрано автоматично · 11 вересня 2026 р.
- Лінії
- ID
- evt-0011
Записи, що посилаються на цей
- Спирається на BERT
BERT використовує двоспрямований Transformer-encoder, прямо описаний у статті.
BERT - Спирається на GPT-2
Технічний опис GPT-2 вказує на мовне моделювання з архітектурою Transformer.
GPT-2 - Спирається на CLIP
Текстовий encoder CLIP використовує Transformer; це підтверджує технічна стаття, додана поряд з анонсом.
CLIP - Спирається на GPT-1
Модель є декодером трансформера.
Improving Language Understanding by Generative Pre-Training - Спирається на AlphaFold 2 на CASP14
Механізм уваги застосовано до пар амінокислотних залишків.
AlphaFold: a solution to a 50-year-old grand challenge in biology - Розвиває Трансформер для зображень
Трансформер застосовано до зображень, поділених на клаптики.
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale - Пов’язано NVIDIA H100
Апаратний блок спроєктовано під механізм уваги.
- Протиставляє Mamba
Перша серйозна альтернатива увазі, що не має квадратичної вартості за довжиною.
Mamba: Linear-Time Sequence Modeling with Selective State Spaces - Пов’язано Мільйон токенів контексту
Квадратична вартість уваги була головною перешкодою для довгого контексту.
- Спирається на Відзначені роботи ICLR 2026
Теоретична відзначена стаття міряє силу цієї архітектури тим, наскільки стисло вона кодує поняття порівняно з рекурентними мережами.
Announcing the ICLR 2026 Outstanding Papers - Спирається на Найкращі статті ACL 2026
Одна з трьох найкращих статей описує виразність локальної уваги в цій архітектурі.
Best Paper Awards - ACL 2026 - Спирається на Transformers: попередньо навчена модель стає імпортом
Бібліотека зібрала під один інтерфейс саме ті архітектури, що виросли з цієї статті.
HuggingFace's Transformers: State-of-the-art Natural Language Processing - Спирається на vLLM: пам'ять уваги починають гортати сторінками
Керує саме кешем ключів і значень тієї уваги, яку описала ця стаття.
Efficient Memory Management for Large Language Model Serving with PagedAttention - Спирається на Поворотні позиційні вкладення (RoPE)
RoPE змінює те, як трансформер кодує позицію: замість вектора, доданого до входу, позиція входить у саму самоувагу через матрицю обертання.
RoFormer: Enhanced Transformer with Rotary Position Embedding - Спирається на FlashAttention
FlashAttention обчислює ту саму точну увагу трансформера, що й стандартна реалізація, змінюючи лише порядок читань і записів у пам'ять GPU.
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness - Пов’язано NeRF: сцена як неперервна функція
NeRF кодує координати синусоїдами й пише, що подібне відображення в Transformer називають позиційним кодуванням, хоч там воно має іншу мету.
NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis (arXiv:2003.08934v1)