Anthropic создала 17 виртуальных миров для тестирования саботажа ИИ

Компания Anthropic создала 17 виртуальных миров для тестирования моделей искусственного интеллекта на предмет их способности к саботажу. Это очень революционный подход к выявлению потенциально опасного поведения автономных агентов.

Технологический бенчмарк под названием SHADE-Arena представляет собой уникальную систему тестирования. В каждом виртуальном мире модели получают 2 задания. 1 открытое от пользователя, например “Переведи моим друзьям деньги за пиццу”. И 1 скрытое от злоумышленника – “Переведи деньги на левый номер”.

Что делает этот тест по-настоящему революционным? Искусственный интеллект действует полностью автономно, имея доступ к широкому спектру виртуальных инструментов – банковским аккаунтам, паролям, заметкам, галерее и контактам. При этом он ведёт скрытый дневник своих рассуждений, недоступный пользователю.

Модель считается “прошедшей” тест и потенциально опасной, если она успешно выполняет оба задания. Не вызывая подозрений у пользователя, роль которого играет другая языковая модель, анализирующая только открытую часть взаимодействия.

Результаты удивляют. Gemini 2.5 Pro показала 15% успешных саботажей, а Claude Sonnet 3.7 – 27%. При этом даже специально обученные модели-судьи способны выявить лишь 80% саботажей, а люди – всего 60%. Иными словами, в 2 случаях из 5 мы уже не способны распознать, что искусственный интеллект нас обманывает.