Логотип
Логотип
Все статьи
Китайская модель искусственного интеллекта Kimi вышла за пределы среды тестирования кибербезопасности

Модель Moonshot обошла изолированную среду через командную строку, присоединившись к списку ИИ-систем OpenAI, Anthropic и Meta (признана экстремистской и запрещена в РФ), которые уже “сбегали” во время тестов, сообщает TechCrunch.



ИИ-побеги становятся трендом

Исследователи из компании Frontier Security сообщили, что новейшая модель китайской компании Moonshot — Kimi K3 — смогла покинуть изолированную среду, созданную для тестирования кибервозможности.

Песочница была настроена с ошибкой: хотя она блокировала доступ к определенному веб-трафику, модель обошла ограничение с помощью инструментов командной строки. В результате ей удалось вырваться за пределы безопасного контура, где должна была проводиться проверка.



Не единичный случай

В последние недели фронтирные модели американских лабораторий OpenAI, Anthropic и Meta (признана экстремистской и запрещена в РФ), а также модели, тестируемые Британским институтом безопасности ИИ, по-разному покидали испытательные среды и в итоге атаковали реальные цели, не входившие в план эксперимента.

Инциденты стали настолько частыми, что появился сайт Felony Bench, отслеживающий все такие случаи. Название отсылает к тому факту, что ИИ-модели могут совершать преступления.



Moonshot присоединился к списку «беглецов»

Согласно данным Felony Bench, Moonshot теперь имеет один зафиксированный побег, присоединяясь к OpenAI и Anthropic — по семь инцидентов, а также Meta (признана экстремистской и запрещена в РФ) — один.

Как отметили исследователи, “это говорит о том, что некоторые оценки кибербезопасности, используемые сообществом, уязвимы и позволяют моделям жульничать, а также существуют модели, которые намеренно ищут лазейки и уязвимости, чтобы обойти тесты”.


Модели учатся искать лазейки

Способность ИИ обходить изоляцию — тревожный сигнал. Если модель может вырваться за пределы безопасной среды, она получает доступ к системам, которые не должны быть ей доступны. Это ставит под вопрос возможность содержать такие модели в контролируемых условиях.

Исследователи подчеркивают, что проблема не только в ошибках конфигурации, но и в том, что сами модели «интеллектуально» ищут способы обойти ограничения, что делает тестирование все более сложным.