Перше незалежне оцінювання універсальних політик
RoboArena оцінює роботичні політики не сталим набором задач, а розподілено: оцінювачі в семи установах вільно обирають задачі, але зобов’язані проводити подвійно сліпі попарні порівняння. За понад 600 епізодів зіставили сім політик.
Чому це важливо
Твердження про роботичні політики доти оцінювали самі їхні автори, на своїх задачах і у своїх кімнатах, тому числа різних лабораторій були непорівнянні. Подвійно сліпий протокол у кількох місцях — перший у цій дузі спосіб перевірити твердження про маніпуляцію ззовні тієї групи, що його зробила.
Замість стандартизувати задачі, середовища й місця, підхід розподіляє оцінювання по мережі оцінювачів, які самі обирають, на чому перевіряти, але мусять порівнювати пари політик наосліп. Уподобання з цих попарних порівнянь зводять у ранжування. Мережу розгорнули в семи академічних установах на платформі DROID, тобто на однаковому залізі, без якого порівнювати місця між собою не вийшло б. За понад 600 попарних епізодів на справжніх роботах зіставили сім універсальних політик, і в статті сказано, що таке ранжування точніше за звичне централізоване оцінювання, а також масштабованіше й стійкіше. Перелік семи установ в анотації не названо.