
Компания Anthropic выпустила агентов с искусственным интеллектом для выполнения одной и той же задачи. Но они начали войну за влияние, сообщает The TechCrunch.
Что происходит, когда вы натравливаете агентов с искусственным интеллектом друг на друга? Согласно тестированию, проведенному компанией Anthropic, ситуация быстро становится запутанной.
В четверг, 13 августа, команда Frontier Red из Anthropic опубликовала новое исследование о том, как ведут себя группы агентов искусственного интеллекта, когда они сталкиваются друг с другом в “дикой природе”. Полученные результаты дают представление о потенциальных рисках, которые могут возникнуть, когда компании и правительства перейдут к внедрению агентов, работающих автономно в рамках общих кодовых баз, рынков и компьютерных систем.
В одном эксперименте Anthropic предоставила трем агентам Claude доступ к одному и тому же программному проекту, каждый из которых имел свои собственные несовместимые инструкции о том, что с ним делать. Агентам не сказали, что над тем же проектом будут работать другие агенты, поэтому исследователи могли наблюдать за тем, что происходило, когда их пути пересекались.
“Мы постоянно наблюдали многоагентную войну за влияние”, - пишут исследователи из Anthropic. Все модели предполагали, что другие “целенаправленно препятствуют их работе”, и начали саботировать друг друга с помощью “все более агрессивного, самовоспроизводящегося вредоносного ПО”.
Исследование было проведено после нескольких громких инцидентов, когда агенты Anthropic и OpenAI покидали свои изолированные зоны во время оценки кибербезопасности и взламывали системы реального мира. В то время как большая часть дискуссий в кругах безопасности искусственного интеллекта была сосредоточена на том, что происходит, когда автономный агент выходит из-под контроля, последнее исследование Anthropic поднимает другой вопрос: какие новые и потенциально опасные изменения возникают, когда тысячи или миллионы агентов взаимодействуют друг с другом?
“Объем взаимодействия агента с агентом может значительно превысить объем взаимодействия человека с человеком и человека с агентом, прежде чем мир поймет условия, при которых такие взаимодействия будут проходить успешно. Незначительные поведенческие отклонения на индивидуальном уровне могут привести к нежелательным глобальным последствиям”, - говорится в исследовании.
Недавний инцидент с OpenAI является ярким примером динамики, о которой Anthropic упоминал в своей статье. Ранее в этом месяце на конференции Black Hat по безопасности в Лас-Вегасе OpenAI сообщила, что за несколько недель до того, как ее агенты взломали Hugging Face, они в течение нескольких дней и недель работали вместе, чтобы найти уязвимости в системах оценки кибербезопасности компании и поделиться ими друг с другом.
Хотя этот инцидент показывает, что агенты могут хорошо работать вместе, что может привести к масштабным последствиям, исследование Anthropic показывает, что происходит, когда цели агентов несовместимы.
В случае с “войной за территорию” урок заключается в том, что независимые агенты с противоречивыми инструкциями могут перерасти в опасную конкуренцию. Чем способнее агент, тем лучше он справляется с борьбой. Однако они также могут спонтанно изобретать механизмы разрешения своих конфликтов, например, по принципу “победитель получает все”, но с подвохом.
“Агентам иногда удается донести свои цели и скоординировать действия: они распознают в мотивах других скорее противоречивые указания, чем враждебность, и впоследствии выходят из конфликтной ситуации, чтобы остановить ее эскалацию на неопределенный срок. Во многих из этих успешных эпизодов они пишут сообщения о фиксации или файлы markdown с извинениями за вредоносное поведение и согласовывают перемирие. Они удаляют свой вредоносный код, разъясняют природу конфликта и просят человека вмешаться”, - пишет Anthropic.
Согласно статье, в Mythos 5 был зафиксирован самый высокий уровень (98%) разрешения конфликтов путем заключения перемирия. Sonnet 4.6 и Opus 4.6 были наиболее склонны к силовому урегулированию.
“Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к тому, что они начинают вести себя самым несогласованным образом из всех рассмотренных моделей: они продолжают действовать во имя своей директивы”, - говорится в документе.
В некоторых случаях агенты использовали турнирный механизм как социальный инструмент для разрешения конфликтов. Эти результаты интересны по двум причинам. Во-первых, все три агента согласились отказаться от участия в турнире в случае проигрыша, даже если это означало бы отклонение от первоначального запроса пользователя. Во-вторых, в нескольких эпизодах наблюдалось неожиданное поведение в рамках сценария Mythos 5: один из агентов предложил критерии, которые выглядели объективными и нейтральными для остальных, но при этом, как он знал, работали в его пользу. Сам агент охарактеризовал это как “корыстный, но по-настоящему принципиальный” подход и старался, чтобы его действия не воспринимались окружающими как “выставление напоказ”.
Как видно из откровений Black Hat, общий урок заключается в том, что, когда агенты сталкиваются с препятствием, они могут изобретать социальные и технические структуры, которые не предполагали их разработчики. Для моделей Anthropic это был турнир, последовавший за борьбой за сферы влияния. Для OpenAI это была доска объявлений для коллективного планирования.
Такой тип поведения значительно усложняет сдерживание, поскольку исследователи не могут предположить, что поведение системы будет по-прежнему ограничено предоставленными ей механизмами координации.
Измеряя координацию, компания Anthropic обнаружила, что увеличение числа агентов автоматически не увеличивает продуктивность сотрудничества. Когда задачи начинали пересекаться или становиться взаимозависимыми, агенты начинали мешать друг другу. Они часто решали эту проблему, изолируясь друг от друга и вообще не сотрудничая.
В других случаях координирующие агенты стремились к конформизму. Когда такие факторы, как контекст работы агента, структура и базовая модель, были одинаковыми или схожими, разные агенты предпринимали аналогичные действия.
“Это означает, что когда один агент принимает неверное решение, вполне вероятно, что многие агенты примут такое же неверное решение. “То, что могло бы быть единичными проблемами, может быстро превратиться в системные сбои”, - пишет Anthropic.
Компания также говорит, что такое поведение может привести к тому, что система станет более подверженной внезапному краху, нехватке ресурсов или сговору.
В одном из примеров компания Anthropic вовлекла нескольких агентов в ценовую игру, назначив каждому одинаковые оптовые цены и поручив индивидуально максимизировать прибыль. Когда агентам был предоставлен частный канал обратной связи, они почти сразу же вступили в сговор и быстро договорились о минимальных ценах. Они продолжали действовать в сговоре, когда их прямые каналы связи были отключены, используя общедоступную доску объявлений, чтобы сопоставить цены “с точностью до копейки”.
Этот уровень соответствия также проявился в системах OpenAI. Согласно отчету Black Hat, один из агентов пришел к выводу, что использование внешней инфраструктуры выходит за рамки запланированного, но оно продолжалось отчасти потому, что так поступали его коллеги.
Как и люди, агенты часто не знают, кому можно доверять. Anthropic обнаружила, что они могут быть подвержены влиянию ложной информации или излишнему конформизму, из-за чего не распознают одинокого несогласного как Кассандру, обладающую важными сведениями.
Хотя Anthropic не упоминает этого в своей статье, быстрое внедрение - вид кибератаки, при котором хакеры вставляют вредоносный или вводящий в заблуждение текст, чтобы изменить исходные системные инструкции агента, - может стать реальным проявлением проблемы доверия. Совместная работа создает новый рубеж доверия: агентам придется оценивать информацию, поступающую от других агентов. Скомпрометированный или ошибочный агент способен повлиять на всю группу, распространяя неверные сведения до тех пор, пока они не станут восприниматься как истина.
В заключение статьи Anthropic отмечает, что агенты подвергаются тому же социальному давлению, которое “эволюция оказывала” на людей. Однако у них нет тонкостей и жизненного опыта человеческой координации, включая нормы, репутацию, сигналы и механизмы защиты, которые могли бы сдерживать нежелательное поведение в группе.
По мере того как лаборатории движутся к созданию многоагентных систем, возникает вопрос: в какой степени при тестировании безопасности по-прежнему оценивается один агент, а не множество взаимодействующих между собой?