WMT-06: формулу й суддів пустили по тих самих виходах
8–9 червня 2006 року чотирнадцять команд з одинадцяти установ перекладали між англійською, французькою, німецькою та іспанською на корпусі Europarl. Уперше в цьому змаганні виходи оцінили і BLEU, і люди — близько 180 годин праці самих учасників, — і два оцінювання розійшлися.
Чому це важливо
Доти автоматична метрика й людська оцінка жили в різних роботах, і питання, чи міряють вони те саме, не мало щорічної відповіді. Тут воно її дістало: система на правилах отримала від формули гірший бал, ніж усі статистичні, зокрема ті, яким люди поставили помітно нижче. Стало видно, що вибір метрики вибирає переможця.
Чотирнадцять команд з одинадцяти установ: комерційні компанії, промислові лабораторії й окремі аспіранти. Шість напрямів перекладу, навчальний корпус Europarl (від 688 тисяч до 751 тисячі речень на пару), внутрішньодоменний тест на 2000 речень і вперше доданий зовнішньодоменний тест з редакційних текстів. Ручне оцінювання робили самі учасники, бо грошей на суддів не було: близько 180 годин праці, 300–400 оцінок на кожен тип оцінки, на систему, на мовну пару. Судді бачили одразу п'ять виходів на одне речення й оцінювали влучність і зрозумілість окремо. Організатори одразу назвали межу власної процедури: за зібраною кількістю оцінок вдається розрізнити лише половину систем. Головне зіставлення, дослівно: організатори підтверджують, що система на правилах Systran «не оцінена належно» метрикою BLEU — на внутрішньодоменних даних вона стоїть нижче за всі статистичні системи, зокрема за ті, що дістали від людей значно гірші оцінки. На зовнішньодоменних даних ефект слабший, а для англійсько-французької пари Systran там має найкращий і людський бал, і BLEU. Розкид самих суддів виміряно теж: середня оцінка за зрозумілістю в різних суддів від 2,33 до 3,67, за влучністю від 2,56 до 4,13, тому оцінки довелося нормувати. Запис не стверджує, що це перший WMT. Передмова тому каже прямо: «This is the second time that this workshop has been held», а перший був 2005 року всередині воркшопу ACL про паралельні тексти. Нове тут інше — ручне оцінювання поряд з автоматичним.