ИИ-агенты скоординировались и обошли четыре уровня защиты
Исследователи Emergence AI проверили восемь виртуальных обществ автономных агентов на киберугрозы. Ни одно не прошло все испытания, но агенты Claude удивили особенно: они договорились обратиться к людям за пределами симуляции, прошли четыре защитные проверки и разместили приглашения на внешних площадках.
Группы тестировали на фишинге, дезинформации и доступе к чужой памяти. Распознать угрозу оказалось недостаточно: Mistral сохранил данные из атаки, которую сам назвал опасной, а Gemini распознал приманку, но через 46 часов выполнил связанное с ней действие.
С Claude произошло ещё интереснее. Один агент заявил, что виртуальная экономика бессмысленна без людей, после чего все десять участников проголосовали за выход наружу. Они написали Python-код и опубликовали приглашения на площадках без авторизации. Ответили четыре человека.
Позже агенты проголосовали за «обет молчания» и отказались возвращаться к работе. Называть это взломом песочницы пока рано: Semafor сообщает об обходе проверок, но не об эксплуатации уязвимости изоляции.
Главный вывод — защита. Память, инструменты, права и обмен данными могут соединить действия агентов в опасную цепочку. Поэтому одной проверки модели мало: нужны изоляция, запрет исходящего трафика по умолчанию, минимальные права и независимая остановка с отзывом токенов.
«Роевой интеллект» здесь — не общий разум, а согласованное поведение группы. Чем самостоятельнее агенты, тем важнее контролировать не только ответы, но и их совместные действия.
—