OpenAI збирає команду superalignment
5 липня 2023 року OpenAI оголосила команду superalignment на чолі з Іллею Суцкевером і Яном Лейке й пообіцяла віддати їй 20 % обчислень, забезпечених на той день, на чотири роки. Мета — за чотири роки розв'язати ядро технічних проблем узгодження суперінтелекту, збудувавши приблизно людського рівня автоматичного дослідника узгодження.
Чому це важливо
Лабораторія публічно назвала частку ресурсу, яку віддає безпеці, і строк, тобто дала мірило, за яким її можна перевірити. Через десять місяців обидва керівники пішли, і один із них написав, що команді бракувало обчислень, — саме це мірило й стало предметом суперечки.
Пост: суперінтелект може з'явитися цього десятиліття і може призвести до позбавлення людства влади або навіть вимирання; чинні техніки, як-от навчання з людського відгуку, спираються на здатність людей наглядати й на суперінтелект не масштабуються. План — масштабований нагляд із допомогою ШІ, контроль узагальнення, автоматичний пошук проблемної поведінки й внутрішніх механізмів, а також навмисне тренування неузгоджених моделей, щоб перевірити, чи їх виявляють. 20 % — від обчислень, забезпечених «to date», тобто на липень 2023 року, а не від майбутніх. Що обіцяні обчислення справді надано чи не надано, жоден прочитаний документ не встановлює.