Індекс прозорості: з чого зроблено модель, не каже ніхто
19 жовтня 2023 року стенфордський центр CRFM оцінив десятьох найбільших розробників базових моделей за сотнею показників прозорості. Середній бал — 37 зі 100, найвищий у Meta (54), найнижчий в Amazon (12).
Чому це важливо
Доти про закритість навчальних даних говорили як про відчуття. Тут її вперше поміряли однією лінійкою для всіх і показали, що найгірше розкрито саме початок ланцюга — дані, праця розмітників і обчислення, — тобто те, від чого залежать усі суперечки про авторське право.
Сто показників поділено на початок ланцюга (дані, праця, обчислення, методи, код), саму модель і використання далі. Кожного розробника оцінювали за його головною моделлю: GPT-4 для OpenAI, PaLM 2 для Google, Llama 2 для Meta. Середні бали підрозділів на початку ланцюга: дані — 20 %, праця розмітників — 17 %, обчислення — 17 %. Три розробники (AI21 Labs, Inflection, Amazon) не набрали жодного з 32 показників цієї частини; найкращий результат там у Hugging Face — 21 із 32. Найрізкіше твердження звіту стосується не середніх. Жодна з десяти компаній не набрала балів за показники про творців даних, про авторсько-правовий і ліцензійний статус даних і про пов'язані з авторським правом застереження. Не «мало» — нуль із десяти.