Колапс моделі на власних виходах
24 липня 2024 року в Nature вийшла рецензована стаття, яка описала колапс моделі: коли покоління за поколінням навчають на тому, що згенерувало попереднє, хвости початкового розподілу зникають незворотно. Показано на мовних моделях, варіаційних автокодувальниках і сумішах гаусіан.
Чому це важливо
Доти синтетичні дані обговорювали як спосіб обійти вичерпання текстів. Стаття перевела питання з практики в теорію й назвала ціну: дані про справжню людську взаємодію тим цінніші, чим більше в мережі машинного тексту.
Автори відділяють ранній колапс від пізнього. У ранньому модель втрачає відомості про хвости розподілу; у пізньому розподіл звужується до малої дисперсії навколо моди й мало нагадує початковий. Причина — не одна, а три: похибка скінченної вибірки, обмежена виразність моделі й похибка самої процедури навчання. Дослід: OPT-125m від Meta, донавчена на wikitext2, далі кожне наступне покоління вчиться на тексті, який породило попереднє, генерація — променевим пошуком на п'ять шляхів, кожен дослід проведено п'ять разів. Щоб умови були найсприятливішими, за основу кожного покоління брали найкращу модель за початковою валідацією — тож у житті ефект може бути сильнішим. Що запис не стверджує. Колапс не є неминучим за будь-яких умов: коли на кожному поколінні домішували випадкові 10 % початкових даних, деградація виявилася незначною. Явище показано на моделях розміру OPT-125m, а не на передових; узагальнення на них стаття робить теоретично, а не вимірює.