Повернутися до часової лінії

Дослідження · 27 травня 2022 р.

FlashAttention

27 травня 2022 року Трі Дао, Деніел Фу, Стефано Ермон і Крістофер Ре зі Стенфорда та Атрі Рудра з Університету в Баффало виклали FlashAttention — алгоритм точної уваги, що обчислює її плитками, аби зменшити кількість читань і записів між високошвидкісною пам'яттю GPU і вбудованою SRAM. Він навчив BERT-large на 15 % швидше від рекорду MLPerf 1.1, GPT-2 — утричі швидше при 1 тис. токенів, Long Range Arena — у 2,4 раза швидше при 1–4 тис.

Чому це важливо

Увагу пришвидшено не наближенням, а підрахунком руху даних у пам'яті — витрати, яку наближені методи залишали. Довший контекст став доступним: перші трансформери, кращі за випадковість на Path-X (16 тис. токенів, 61,4 %) і Path-256 (64 тис., 63,1 %). Falcon 2023 року називає FlashAttention серед своїх архітектурних рішень.

Стаття аналізує складність алгоритму за введенням-виведенням, показує, що він потребує менше звернень до високошвидкісної пам'яті, ніж стандартна увага, і оптимальний для певного діапазону розмірів SRAM, і поширює його на блочно-розріджену увагу. Довший контекст дав на 0,7 кращу перплексію на GPT-2 і 6,4 пункта на класифікації довгих документів.

Відомості про подію

Дата події
27 травня 2022 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 24 вересня 2026 р.
Лінії
ID
evt-0673

Перша з двох версій препринта arXiv:2205.14135, подана 27 травня 2022 року (на титулі — 30 травня); друга — 23 червня 2022.

Джерела

Пов’язані події