Заявлена довжина контексту й дійсна
9 квітня 2024 року NVIDIA опублікувала RULER — набір із 13 завдань, який виміряв, на якій довжині модель насправді ще працює. З десяти перевірених моделей лише чотири витримали 32 тисячі токенів, хоча стільки або більше заявляли всі.
Чому це важливо
Доти довгий контекст перевіряли пошуком «голки в сіні», і його складали майже всі — у таблиці статті це рівні 100,0 на всіх довжинах. RULER показав, що цей тест нічого не міряє, і дав число, яке можна поставити поруч із заявленим: дійсну довжину.
До пошуку одного ключа додано варіанти з багатьма ключами, багатокрокове відстеження сутностей, агрегацію по всьому тексту й питання-відповіді — 13 завдань, довжини від 4 до 128 тисяч токенів, десять моделей. Поріг узято не з повітря: це якість Llama2-7B на 4 тисячах токенів, 85,6 %. Дійсна довжина — найбільша, на якій модель цей поріг ще проходить. Заявлене проти дійсного: GPT-4 — 128K проти 64K; Command-R 35B — 128K проти 32K; Yi 34B — 200K проти 32K; Mixtral 8x7B — 32K проти 32K; Mistral 7B — 32K проти 16K; ChatGLM 6B — 128K проти 4K; LWM 7B — заявлений мільйон проти менш ніж 4 тисяч. Запис не стверджує, що поріг 85,6 % є чимось природним: автори самі називають його «якісним» і виводять з однієї опорної моделі. Окремо перевірено дві нетрансформерні архітектури, RWKV-v5 і Mamba-2.8B: обидві помітно деградують уже на 8 тисячах токенів.