Статистичний переклад у Google
У квітні 2006 року Google відкрив для всіх свою статистичну систему перекладу арабська↔англійська, про що 28 квітня написав Франц Ох. Систему навчено на мільярдах слів одномовних текстів і паралельних людських перекладів; на оцінюванні NIST 2005 року вона мала найвищий BLEU серед учасників для арабської й китайської.
Чому це важливо
Переклад, побудований статистичним навчанням на великих даних, вийшов із дослідницьких оцінювань у загальнодоступний продукт; на оцінюванні NIST за рік до того ця система випередила і дослідницькі статистичні системи, і SYSTRAN на правилах.
NIST MT-05, офіційні результати від 1 серпня 2005 року, BLEU-4, доріжка великих даних: арабська→англійська — Google 0,5131, ISI 0,4657, IBM 0,4646, SYSTRAN 0,1079; китайська→англійська — Google 0,3531, ISI 0,3073, SYSTRAN 0,1471. По 100 новинних статей AFP і Xinhua на мову, чотири людські переклади кожної. NIST застерігає, що оцінено дослідницькі системи, а не комерційні продукти. Посилання в дописі на ці результати тепер веде на головну сторінку NIST, тож прочитано архівну копію того самого файла. Дня запуску допис не називає. Запис не стверджує, коли Google переклав на власну систему решту мовних пар: жодного джерела про це не прочитано.