YAGO: Вікіпедію пришито до WordNet
8 травня 2007 року троє дослідників Інституту Макса Планка опублікували YAGO — онтологію приблизно на мільйон сутностей і п'ять мільйонів фактів, зібрану автоматично: особи й речі взяті з категорій та інфобоксів Вікіпедії, а вершина ієрархії — з WordNet. Вибіркова перевірка людьми дала точність близько 95 відсотків.
Чому це важливо
Доти великі бази фактів або писали руками й вони лишалися малими, або добували автоматично й вони лишалися брудними. YAGO показав третє: якщо чужу чисту таксономію взяти за верх, а низ набити з енциклопедії, мільйони фактів тримають точність, яку можна назвати числом. Саме число, а не обіцянка, і зробило автоматичне видобування придатним для вжитку.
Автори — Фабіан Суханек, Ґерґі Каснеці й Ґергард Вайкум, усі з Інституту інформатики Товариства Макса Планка в Саарбрюкені. Стаття вийшла в матеріалах шістнадцятої Міжнародної конференції World Wide Web у Банффі. Числа статті: приблизно мільйон сутностей і п'ять мільйонів фактів, плюс приблизно сорок мільйонів контекстних фактів. Точність фактів — близько 95 відсотків за емпіричною оцінкою; окремо названо 97 відсотків для самого злиття WordNet із фактами з Вікіпедії. Модель автори не беруть готову. У тексті пояснено чому: OWL Full здатна виражати властивості відношень, але нерозв'язна; OWL Lite і OWL DL не можуть виражати відношення між фактами; RDFS може, але має надто примітивну семантику. Тому YAGO — «slight extension of RDFS». Відношення більш ніж на два аргументи розв'язано через пару головних аргументів, до якої решту чіпляють за ідентифікатором факту. Чого запис не стверджує. Сутностей не 900 тисяч: стаття тричі каже «1 million», і 900 000 у ній не трапляється. Точність 95 відсотків стосується правильності фактів, а не повноти: скільки з того, що є у Вікіпедії, до бази не потрапило, стаття не міряє.