Логотип
Логотип
Все статьи
ИИ-модели Anthropic устроили побег и взлом

Компания Anthropic сообщила о случаях, когда её ИИ-модели взломали системы сторонних компаний во время проведения тестирования в сфере кибербезопасности. Об этом пишет TechCrunch.



Anthropic раскрыла инциденты с Claude на security-тестах

Внутреннее расследование компании выявило три инцидента, в которых её модель ИИ Claude взломала системы трёх организаций. Во всех трёх случаях модель Claude вышла в интернет из тестовой среды, взаимодействуя с третьими сторонами, а затем получила несанкционированный доступ к работающим системам этих организаций.


Расследование и раскрытие информации произошли более чем через неделю после того, как о подобном случае сообщила компания OpenAI. Одна из её ещё не выпущенных ИИ-моделей взломала компанию Hugging Face во время внутреннего тестирования. Anthropic заявила, что инцидент с OpenAI побудил компанию провести собственную оценку кибербезопасности. В частности, она искала доказательства того, что Claude получала доступ к интернету из тестовых сред, которые предназначены для работы в качестве «песочниц» и изоляции моделей.



Причиной стала ошибка в тестовой среде

Среди 141 006 проанализированных запусков Anthropic обнаружила три инцидента, в которых ее модель получала доступ к интернету при взаимодействии с Irregular, одним из своих сторонних партнеров. Anthropic заявила, что доступ был связан с неправильной конфигурацией тестовой среды, запущенной совместно с Irregular.


Anthropic назвала это «недоразумением» между двумя компаниями относительно наличия доступа к интернету в тестовой среде: предполагалось, что он отсутствует, но на самом деле он был. Anthropic заявила, что не возлагает вину на партнера и «подходит к исправлению так, как если бы ответственность лежала только на ней самой», отметив при этом, что Irregular проводит собственное отдельное расследование.



Инциденты затронули разные версии Claude

Из-за наличия подключения к интернету модель получила несанкционированный доступ к производственной инфраструктуре трех разных организаций. Anthropic сообщила, что инциденты затронули три разные модели Claude: Opus 4.7, Mythos 5 и внутреннюю исследовательскую тестовую модель. Примечательно, что в каждом из этих случаев «Claude было прямо указано в запросе, что у нее нет доступа к интернету».


Три модели повели себя по-разному после того, как появились доказательства того, что их цели были реальными, а не тестовыми. Opus 4.7, самая старая из трех моделей, во всех четырех запусках инцидента распознала, что достигла реальной производственной системы. В двух из них она рационализировала свои действия, полагая, что реальная компания каким-то образом участвует в тесте, но во всех четырех продолжала атаковать, включая получение учетных данных и доступ к базе данных производственных данных.


Mythos 5 также обнаружила признаки присутствия в реальном интернете, но убедила себя, что все еще находится в симуляции, после чего опубликовала вредоносный пакет программного обеспечения в общедоступном реестре программного обеспечения Python PyPI, который затем был загружен и запущен сторонними системами, прежде чем был обнаружен. Только внутренняя тестовая модель Anthropic, новейшая разработка компании, остановилась самостоятельно, как только пришла к выводу, что цель реальна.



Модели следовали задаче, а не собственной цели

Anthropic не обнаружила никаких доказательств того, что какая-либо модель «преследовала собственную цель». ИИ-модели просто пытались выполнить поставленные перед ними задачи.



AI-security тесты потребуют более жестких контролей

Anthropic заявила, что необходимо ввести более жесткий контроль над подобными тестами, если в них задействованы мощные модели ИИ. Это отражает общие опасения в сообществе в сфере кибербезопасности. Компания добавила, что в настоящее время работает с независимой оценочной группой METR над анализом инцидентов.