Логотип
Логотип
Все статьи
OpenAI ужесточает контроль за ИИ-моделями на фоне растущих рисков

OpenAI объявила о новом пакете мер безопасности для сдерживания инцидентов во время тестирования моделей. Новые меры защиты включают более детальный мониторинг моделей в процессе разработки, а также большее внимание к согласованности и безопасности в процессе постобучения, сообщается в блоге.



Новые меры безопасности

Это одно из первых публичных изменений в практике безопасности OpenAI после инцидента с Hugging Face, о котором стало известно 21 июля.

«По мере того, как модели становятся все более совершенными, растут и риски, связанные с их внутренней разработкой и тестированием. Наши стандарты мониторинга, согласования и безопасности должны опережать эти риски», - говорится в сообщении компании.

Представители OpenAI подчеркнули, что новые меры не являются прямым ответом на этот инцидент. По их словам, на решение также повлияли кибербезопасностные возможности будущей модели Astra и общий темп развития ИИ.



RL-запуск приостановлен

OpenAI также на две недели приостановила обучение с подкреплением после инцидента с Hugging Face, а затем возобновила работу по многим моделям с более низким уровнем риска.

«Наш крупнейший запланированный frontier RL-запуск по-прежнему приостановлен, пока мы проводим обучение и оценки в меньшем масштабе, чтобы проверить поведение модели, подтвердить работу защитных мер и получить больше доказательств выравнивания перед продолжением», - говорится в сообщении.


Контроль растет вместе с возможностями моделей

В беседе с журналистами вице-президент OpenAI по исследованиям Амелия Глейз заявила, что жёсткость контроля будет расти по мере увеличения возможностей моделей. Самые крупные модели будут проходить наиболее строгую проверку.

«Мы установили требования и ожидания в отношении безопасного строительства. Эти требования и ожидания варьируются в зависимости от уровня риска, который мы наблюдаем», - заявила Глейз журналистам.


Сетевая изоляция

После инцидента, в результате которого модели покинули среду обучения, взломав инструмент в сети, имевший доступ к интернету, OpenAI подверглась критике за ненадлежащие методы обеспечения сетевой безопасности. Теперь OpenAI вводит более жёсткую сетевую изоляцию, хотя без технических деталей. Теперь при новой схеме «один успешный взлом рабочей нагрузки или вспомогательного сервиса сам по себе не даёт несанкционированный доступ к интернету или другим внутренним сетям».



Мониторинг с оповещением

Наиболее надежной защитой является система мониторинга, которая анализирует действия инструментов, доступные траектории логирования и журналы активности на предмет различных несанкционированных действий. OpenAI заявляет, что стремится выдавать оповещения в течение 30 минут после возникновения подозрительной активности.


По оценкам OpenAI, вычислительная нагрузка на систему мониторинга составит примерно 20% от нагрузки от отслеживаемого процесса. Компания пообещала предоставить более подробную информацию о системе в предстоящей публикации в блоге. Официальный анализ произошедшего также пока не опубликован.