Розрив у двадцять три бали корейською
2 квітня 2024 року команда NAVER Cloud опублікувала технічний звіт про HyperCLOVA X. На корейських тестах KMMLU, HAE-RAE й KoBigBench старша модель HCX-L дала середнє 72,07 проти 48,92 у LLaMA 2 70b, а на англійських MMLU, BBH та AGIEval — 58,25 проти 58,33, тобто нарівні.
Чому це важливо
Ці два рядки разом і є аргументом: та сама модель, що йде нарівні англійською, випереджає на двадцять три бали корейською. Отже розрив походить не з розміру й не з архітектури, а з того, чого в англоцентричному наборі просто немає. Автори прямо пишуть, що подають це як зразок для країн, які будують власні моделі.
Сімейство складається з HCX-L і легшої HCX-S. Навчання йшло на збалансованій суміші корейської, англійської та коду, з подальшим донавчанням на розмічених людьми наборах. Оцінювання охоплює міркування, знання, здоровий глузд, фактичність, код, математику, розмову, виконання інструкцій і нешкідливість, обома мовами. Окремо показано перенесення між мовами, зокрема машинний переклад для кількох пар і міжмовне виведення для мов, на які модель не націлювали. Чого запис не стверджує. Трьох тверджень звіту в жодному з джерел немає. Корпус, більший за GPT-3 у 6500 разів: рядок «6,500» трапляється в цьому звіті нуль разів, і в статті 2021 року про першу HyperCLOVA теж нуль — там сказано про корейськоцентричний корпус на 560 мільярдів токенів. Дата-центр GAK Sejong на 600 тисяч серверів: «Sejong» — нуль разів, «600,000» — нуль разів. Через це запис перенесено з дати запуску сервісів 24 серпня 2023 року на дату звіту, де числа справді є, а впевненість лишається середньою: це звіт компанії про власну модель, і другого незалежного виміру знайти не вдалося.