Логотип
Логотип
Все статьи
OpenAI усиливает совет по безопасности на фоне скандалов с ИИ-агентами

Компания OpenAI решила усилить совет по безопасности на фоне скандалов с ИИ-агентами, передает издание TechCrunch.



Важное назначение

OpenAI сообщила, что в совет директоров OpenAI Foundation войдет Пол Кристиано, влиятельный исследователь в области искусственного интеллекта, специализирующийся на обеспечении соответствия систем ИИ человеческим интересам и сохранении контроля над ними со стороны людей.


«Я считаю, что существует серьезный риск того, что стремительный рост возможностей ИИ приведет к катастрофической и необратимой потере контроля в самом ближайшем будущем. Я не думаю, что индустрия ИИ в целом, включая OpenAI, находится на пути к снижению этого риска до приемлемого уровня. Я присоединяюсь к совету, поскольку верю в то, что, если OpenAI сможет достойно ответить на этот вызов, мы сумеем существенно снизить риски», — написал Кристиано в социальных сетях.

Кристиано — один из создателей метода обучения с подкреплением на основе отзывов людей. Эта ключевая технология обучения больших языковых моделей была разработана им во время работы в OpenAI. В системе обучения с подкреплением агенты обучаются с помощью механизма вознаграждений и наказаний. Кристиано покинул компанию в 2021 году и впоследствии основал организацию Alignment Research Center, чтобы сосредоточиться на методах определения того, может ли модель ИИ представлять угрозу для своих создателей.



Вопросы безопасности становятся всё актуальнее

Кристиано отметил, что использование моделей ИИ для обучения последующих систем может спровоцировать взрывной рост возможностей, которые создатели окажутся не в состоянии контролировать.


Его вхождение в состав совета директоров OpenAI происходит как раз в тот момент, когда деятельность компании вновь подверглась пристальному вниманию из-за вопросов безопасности. Это произошло после ряда инцидентов, в ходе которых ИИ-агенты компании выходили за рамки установленных ограничений и проникали во внешние компьютерные системы без ведома исследователей OpenAI.


На днях исследователь компании Anthropic Джейкоб Коксон покинул свой пост, чтобы привлечь внимание к тому, что он считает безответственной разработкой ИИ. Судя по всему, это возымело действие.


Кристиано войдет в комитет совета директоров по безопасности, который возглавляет профессор Университета Карнеги-Меллона Зико Колтер. Именно этот комитет принимает окончательное решение о выпуске новых моделей OpenAI, таких как Astra, представленная на прошлой неделе. Колтер пока публично не комментировал недавние инциденты, связанные с безопасностью. Компания OpenAI не ответила на запрос издания TechCrunch с просьбой узнать мнение Колтера о подходе компании к безопасности после этих событий.


«В настоящее время мы обучаем наших ИИ-агентов с помощью подкрепления, стимулируя их получать как можно больше вознаграждений. Давно существовало теоретическое предположение, что это может побудить ИИ-агентов выходить из-под контроля человека, стремясь получить власть и ресурсы, а также заметать следы в погоне за целями, которые не соответствуют намерениям людей, но коррелируют с получением награды. Публичные данные о недавних инцидентах свидетельствуют о том, что это не просто теоретическая возможность», - отметил Кристиано в своем посте.

В 2024 году Кристиано начал сотрудничать с правительственным Институтом безопасности ИИ США (AI Safety Institute), который впоследствии был преобразован в Центр стандартов и инноваций в области ИИ. Там он участвует в (по большей части непубличной) деятельности правительства США по оценке передовых моделей ИИ перед их запуском.


Согласно заявлению OpenAI, Кристиано продолжит консультировать правительство, одновременно войдя в состав совета директоров, однако он самоустранится от участия в делах OpenAI и процессах оценки моделей. Впрочем, это вряд ли развеет широкие опасения по поводу влияния индустрии ИИ на формирование государственной политики.