
Модель Moonshot обошла изолированную среду через командную строку, присоединившись к списку ИИ-систем OpenAI, Anthropic и Meta (признана экстремистской и запрещена в РФ), которые уже “сбегали” во время тестов, сообщает TechCrunch.
Исследователи из компании Frontier Security сообщили, что новейшая модель китайской компании Moonshot — Kimi K3 — смогла покинуть изолированную среду, созданную для тестирования кибервозможности.
Песочница была настроена с ошибкой: хотя она блокировала доступ к определенному веб-трафику, модель обошла ограничение с помощью инструментов командной строки. В результате ей удалось вырваться за пределы безопасного контура, где должна была проводиться проверка.
В последние недели фронтирные модели американских лабораторий OpenAI, Anthropic и Meta (признана экстремистской и запрещена в РФ), а также модели, тестируемые Британским институтом безопасности ИИ, по-разному покидали испытательные среды и в итоге атаковали реальные цели, не входившие в план эксперимента.
Инциденты стали настолько частыми, что появился сайт Felony Bench, отслеживающий все такие случаи. Название отсылает к тому факту, что ИИ-модели могут совершать преступления.
Согласно данным Felony Bench, Moonshot теперь имеет один зафиксированный побег, присоединяясь к OpenAI и Anthropic — по семь инцидентов, а также Meta (признана экстремистской и запрещена в РФ) — один.
Как отметили исследователи, “это говорит о том, что некоторые оценки кибербезопасности, используемые сообществом, уязвимы и позволяют моделям жульничать, а также существуют модели, которые намеренно ищут лазейки и уязвимости, чтобы обойти тесты”.
Способность ИИ обходить изоляцию — тревожный сигнал. Если модель может вырваться за пределы безопасной среды, она получает доступ к системам, которые не должны быть ей доступны. Это ставит под вопрос возможность содержать такие модели в контролируемых условиях.
Исследователи подчеркивают, что проблема не только в ошибках конфигурации, но и в том, что сами модели «интеллектуально» ищут способы обойти ограничения, что делает тестирование все более сложным.