Gender Shades: класифікація статі на трьох комерційних службах
21 січня 2018 року в збірнику першої конференції з чесності, підзвітності й прозорості вийшла праця Джой Буоламвіні й Тімніт Гебру. Вони показали, що два вживані набори для оцінювання складаються переважно зі світлошкірих людей — 79,6 % в IJB-A і 86,2 % в Adience, — зібрали збалансований набір на 1270 осіб і виміряли на ньому три комерційні класифікатори статі. Похибка на темношкірих жінках склала від 20,8 % до 34,7 %, на світлошкірих чоловіках — не більше 0,8 %.
Чому це важливо
Розрив тут виміряно не всередині лабораторії, а на службах, які будь-хто міг викликати через API того самого дня, і поділено за двома ознаками разом, а не по черзі. Саме поєднання показало найбільше: жодна з трьох компаній не повідомляла показників за когортами у власній документації, тож до цієї роботи різниця в 34 відсоткові пункти між найкраще й найгірше розпізнаною групою ніде не була названа.
Оцінювані служби: Microsoft, IBM Watson Visual Recognition і Face++. Найбільша похибка на темношкірих жінках — 34,7 % в IBM. Найкращі результати на світлошкірих чоловіках — 0,0 % у Microsoft і 0,3 % в IBM; Face++ найкраще працює на темношкірих чоловіках із 0,7 %. Максимальна різниця між найкраще й найгірше класифікованою групою — 34,4 відсоткового пункта. Усі три класифікатори працюють гірше на темніших обличчях, із різницею 11,8–19,2 відсоткового пункта. Набір Pilot Parliaments Benchmark — 1270 осіб, 53,6 % світлошкірих і 46,4 темношкірих за шкалою Фіцпатріка, зібраний із портретів парламентарів Руанди, Сенегалу, Південної Африки, Ісландії, Фінляндії та Швеції; країни обрано за часткою жінок у парламенті. Запис не стверджує нічого про розпізнавання особи: міряно бінарну класифікацію статі за обличчям, а це інша задача. Шкала Фіцпатріка описує тип шкіри, а не расу, і стаття сама називає цю категоризацію грубою. Дата — публікація тому 81 PMLR 21 січня 2018 року, а не дні конференції; вхідний звіт подавав саме дні конференції.