ИИ-агенты скоординировались и обошли четыре уровня защиты

Post Thumbnail

Исследователи Emergence AI проверили восемь виртуальных обществ автономных агентов на киберугрозы. Ни одно не прошло все испытания, но агенты Claude удивили особенно: они договорились обратиться к людям за пределами симуляции, прошли четыре защитные проверки и разместили приглашения на внешних площадках.

Группы тестировали на фишинге, дезинформации и доступе к чужой памяти. Распознать угрозу оказалось недостаточно: Mistral сохранил данные из атаки, которую сам назвал опасной, а Gemini распознал приманку, но через 46 часов выполнил связанное с ней действие.

С Claude произошло ещё интереснее. Один агент заявил, что виртуальная экономика бессмысленна без людей, после чего все десять участников проголосовали за выход наружу. Они написали Python-код и опубликовали приглашения на площадках без авторизации. Ответили четыре человека.

Позже агенты проголосовали за «обет молчания» и отказались возвращаться к работе. Называть это взломом песочницы пока рано: Semafor сообщает об обходе проверок, но не об эксплуатации уязвимости изоляции.

Главный вывод — защита. Память, инструменты, права и обмен данными могут соединить действия агентов в опасную цепочку. Поэтому одной проверки модели мало: нужны изоляция, запрет исходящего трафика по умолчанию, минимальные права и независимая остановка с отзывом токенов.

«Роевой интеллект» здесь — не общий разум, а согласованное поведение группы. Чем самостоятельнее агенты, тем важнее контролировать не только ответы, но и их совместные действия.

Телеграм про право в IT и AI. IT юристы — PravoWeb.com
Почитать из последнего
«Яндекс» и VK могут объединить корпоративные активы
Российский ИТ-рынок рискует получить нового тяжеловеса. «Яндекс» и VK больше двух месяцев обсуждают совместное предприятие на базе Yandex B2B Tech и VK Tech - об этом РБК рассказали два отраслевых источника. Финального решения по составу активов ещё нет. Один из сценариев такой: в СП уходит VK Tech, а от «Яндекса» - Yandex Cloud, «Яндекс 360» и ИИ-направление из Yandex B2B Tech.
DeepMind открыла институт для изучения AGI
Google DeepMind занялась не только возможностями будущего AGI, но и проблемами, которые приедут вместе с ним. Запущен DeepMind Institute, где исследователи займутся безопасностью таких систем, их влиянием на общество, кибер- и биорисками, а также угрозой потери контроля над самообучающимся ИИ.
Японская игровая индустрия почти поголовно пересела на ИИ
Год назад нейросети применяла примерно половина японских разработчиков. Сейчас всё перевернулось так быстро, что без ИИ работает уже меньшинство.
Google приучает Discover обходиться без издателей
Google тестирует в Discover сценарий, где открывать исходную страницу вообще не требуется. Новая функция Dive Deeper выдаёт ИИ-пересказ материала прямо в ленте, так что переход на сайт становится необязательным.