Повернутися до часової лінії

Дослідження · 2 січня 2024 р.

Розміщено за датою сучасного події першоджерела. Точна дата події невідома; нижче наведено підтверджений часовий інтервал.

Самогра проти власного попереднього стану

2 січня 2024 року UCLA описала SPIN: модель учиться відрізняти власні відповіді попередньої ітерації від людських відповідей того самого набору SFT. Середній бал zephyr-7b-sft-full на Open LLM Leaderboard зріс із 58,14 до 63,16 за три ітерації, без жодної нової розмітки.

Чому це важливо

Доти вихід за плато після SFT означав або нову розмітку людьми, або відповіді сильнішої комерційної моделі як учителя. SPIN показала третє джерело сигналу — контраст із власним минулим станом, — і воно виявилося дешевшим за обидва.

Ітерації з таблиці першої версії: 58,14 → 60,80 → 62,26 → 62,97 → 63,16, тобто приріст швидко спадає. На MT-Bench 5,94 → 6,78. Найбільше додали GSM8k (26,76 → 38,97) і TruthfulQA (43,73 → 54,90) — понад десять пунктів кожен. Використано лише 50-тисячну підмножину Ultrachat200k. Порівняння з DVO: нульова ітерація самогри дає результат, зіставний із DPO, навченим на додаткових 62 тисячах пар уподобань, а з першої ітерації самогра обходить DPO на більшості наборів. Що запис не стверджує. Це не навчання без людських даних: роль зразка, від якого модель учиться відрізняти себе, грають людські відповіді наявного набору SFT. Нової розмітки не потрібно, наявна — потрібна.

Відомості про подію

Дата події
2 січня 2024 р.
Дата на часовій лінії
Дата первинної публікації
Перевірка
Джерела зібрано автоматично · 21 вересня 2026 р.
Лінії
ID
evt-0534

День подання першої версії препринта. Пізніші версії вийшли в лютому й червні 2024 року; числа прочитано у першій.

Джерела

Пов’язані події