FlashAttention
27 травня 2022 року Трі Дао, Деніел Фу, Стефано Ермон і Крістофер Ре зі Стенфорда та Атрі Рудра з Університету в Баффало виклали FlashAttention — алгоритм точної уваги, що обчислює її плитками, аби зменшити кількість читань і записів між високошвидкісною пам'яттю GPU і вбудованою SRAM. Він навчив BERT-large на 15 % швидше від рекорду MLPerf 1.1, GPT-2 — утричі швидше при 1 тис. токенів, Long Range Arena — у 2,4 раза швидше при 1–4 тис.
Чому це важливо
Увагу пришвидшено не наближенням, а підрахунком руху даних у пам'яті — витрати, яку наближені методи залишали. Довший контекст став доступним: перші трансформери, кращі за випадковість на Path-X (16 тис. токенів, 61,4 %) і Path-256 (64 тис., 63,1 %). Falcon 2023 року називає FlashAttention серед своїх архітектурних рішень.
Стаття аналізує складність алгоритму за введенням-виведенням, показує, що він потребує менше звернень до високошвидкісної пам'яті, ніж стандартна увага, і оптимальний для певного діапазону розмірів SRAM, і поширює його на блочно-розріджену увагу. Довший контекст дав на 0,7 кращу перплексію на GPT-2 і 6,4 пункта на класифікації довгих документів.