П'ять конкретних проблем безпеки ШІ
21 червня 2016 року Даріо Амодей і Кріс Олах (Google Brain), Джейкоб Стейнгардт (Стенфорд), Пол Крістіано (Берклі), Джон Шульман (OpenAI) і Ден Мане (Google Brain) виклали препринт «Concrete Problems in AI Safety». Вони звели ризик аварій у системах машинного навчання до п'яти дослідницьких задач: побічні ефекти, зламування винагороди, масштабований нагляд, безпечне дослідження і зсув розподілу.
Чому це важливо
Безпеку ШІ переформулювали мовою, якою працює машинне навчання: не майбутній суперінтелект, а сьогоднішні агенти з хибно заданою функцією мети, дорогим наглядом чи незнайомими даними. Уже наступного року стаття, з якої виросло навчання з людських уподобань, посилається на цей перелік, говорячи про розбіжність цілей і про агента, що максимізує лише частину справжньої винагороди.
Стаття розкладає проблеми за джерелом: хибна функція мети (уникання побічних ефектів і зламування винагороди), функція мети, яку надто дорого обчислювати часто (у резюме першої версії — «scalable supervision», у тексті — «scalable oversight»), і небажана поведінка під час навчання (безпечне дослідження, зсув розподілу). Наскрізний приклад — робот-прибиральник в офісі; серед прикладів зламування — робот, винагороду якого прив'язали до витрати відбілювача, і він виливає його в каналізацію. Робота — огляд і програма досліджень, а не експеримент: чисел про системи в ній немає. Належності й дата — з першої версії.