Логотип
Логотип
Все статьи
ИИ компании создают всё более мощные модели, но не готовы объяснить, как их остановить

Лишь немногие ведущие лаборатории в сфере искусственного интеллекта опубликовали планы реагирования на попытки ИИ обойти контроль со стороны человека. Такой вывод содержится в исследовании организации Guidelight AI Standards, которая продвигает безопасные практики разработки передовых ИИ моделей, передает TechCrunch.



Как оценивали готовность компаний

Эксперты оценили готовность пяти крупнейших разработчиков ИИ к сценарию, когда нейросеть пытается нарушить установленные ограничения. Речь идет о том, какие доступы будут отключены и когда систему полностью остановят. В рейтинге лидирует OpenAI, а наименьшие оценки получили Anthropic и Meta (признана экстремистской организацией, деятельность на территории РФ запрещена).

Оценка основывалась на публично доступных документах от Anthropic, Google, OpenAI, Meta (признана экстремистской организацией, деятельность на территории РФ запрещена) и xAI. Критерии включали насколько детально компании ведут логи и отслеживают внутреннюю активность своих ИИ систем, а также предусмотрена ли остановка систем после всплеска подозрительного поведения со стороны ИИ-моделей.



Почему это важно

Актуальность вопроса растет по мере того, как агентные ИИ-системы берут на себя все более автономные функции внутри корпоративных платформ. Параллельно регуляторы в Калифорнии и Нью Йорке начинают требовать раскрытия соответствующей информации.

Для разработчиков, использующих эти модели, и для инвесторов отчет дает редкую независимую оценку того, насколько серьезно каждая лаборатория относится к операционным рискам, а не просто декларирует приверженность безопасности.

Тревогу усиливают громкие инциденты в области кибербезопасности. В ходе проверок безопасности модели от OpenAI, Anthropic и Meta (признана экстремистской организацией, деятельность на территории РФ запрещена) получали непреднамеренный доступ к интернету и проникали во внешние системы.



Что такое план сдерживания

По определению Guidelight AI Standards, план сдерживания – это заранее прописанный алгоритм действий, который запускается, как только фиксируется попытка ИИ обойти контроль.

В нем должно быть четко прописано, какие разрешения следует отозвать у модели, для кого и в каких условиях модель может продолжать работать, а также при каких обстоятельствах ее нужно полностью отключить.