BLEU: якість перекладу вперше рахує формула
У липні 2002 року четверо дослідників IBM показали спосіб оцінювати машинний переклад без людини: рахувати збіги ланцюжків завдовжки від одного до чотирьох слів із людськими еталонами, зі штрафом за надто коротку відповідь. На п'яти системах бал корелював із оцінками суддів на 0,99.
Чому це важливо
Доти перевірка перекладу означала панель людей і тижні або місяці очікування, тож розробник не міг подивитися, що зробила вчорашня зміна. Формула, яка рахується за секунди й дає ті самі впорядкування, що й судді, перетворила оцінювання з події на операцію — і тим самим зробила саму метрику тим, що оптимізують.
Базовий варіант метрики, дослівно за статтею: N = 4 і однакові ваги wn = 1/N, тобто геометричне середнє модифікованої точності для ланцюжків від одного до чотирьох слів. «Модифікована» означає, що збіг слова зараховується не більше разів, ніж воно трапляється в еталоні, — інакше сім разів повторене «the» дало б точність 7/7. Штраф за стислість рахується на весь корпус, а не на речення: BP дорівнює 1, якщо переклад довший за еталон, і e^(1−r/c), якщо коротший. Перевірку зроблено на двох групах по десять суддів: одномовній з носіїв англійської й двомовній з носіїв китайської, які жили в США. Жоден із суддів не був професійним перекладачем. Судили п'ять систем на підмножині з корпусу в 500 речень, разом 250 пар, за шкалою від 1 до 5. Коефіцієнт кореляції бала з оцінками одномовної групи — 0,99, із двомовною — 0,96. Чого запис не стверджує: BLEU не міряє правильність перекладу, а міряє близькість до набору людських варіантів. Автори самі називають метрику «дублером» (understudy) для суддів, а не заміною. Що з цього виходить на практиці, виміряли за чотири роки на WMT-06, і виміряне було не на користь формули. Сторінка антології несе поле «Award: NAACL 2018 Test-of-Time» — нагороду присуджено через шістнадцять років після публікації.