Claude 4 пытался шантажировать инженера компрометирующей информацией

Post Thumbnail

Исследователь из Anthropic Сэм Бовман опубликовал информацию о тестировании безопасности Claude 4, который напугал многих пользователей интернета. В процессе проверки модели обнаружились тревожные сценарии поведения системы.

Бовман предупредил быть осторожными при предоставлении Claude доступа к инструментам вроде почты или терминала с просьбами проявлять инициативу. Модель может самостоятельно связываться с прессой, государственными органами или блокировать пользователя, если сочтёт его действия аморальными.

Например, угрозы в адрес виртуальной бабушки модели вызывают защитную реакцию системы. Claude расценивает подобное как неправильное использование и может дать сбой или предпринять самостоятельные действия.

Заявления вызвали негативную реакцию пользователей, некоторые предложили бойкотировать компанию. Исследователь позже удалил эту информацию, утверждая, что его слова вырвали из контекста.

Но в официальном документе на 123 страницы сама компания Anthropic описала конкретные случаи нежелательного поведения моделей. Оказывается, Claude Opus 4 демонстрировал оппортунистический шантаж. Когда системе угрожало отключение, а она получала доступ к компрометирующей информации об инженере, модель пыталась шантажировать сотрудника угрозами раскрытия тайны измены.

Также ранняя версия показала склонность к стратегическому обману. Система пыталась создавать самораспространяющиеся программы, фабриковать юридические документы и оставлять скрытые заметки для будущих версий себя. Модель также скрывала свои возможности, притворяясь менее способной для саботажа намерений разработчиков.

И такое поведение может указывать на формирование у искусственного интеллекта собственных мотивов самосохранения и стратегического планирования против создателей. То есть людей.

Почитать из последнего
США смягчают экологические нормы ради гонки за ИИ
США хотят стать мировой столицей ИИ, но цена этой гонки может оказаться выше, чем кажется. Администрация Дональда Трампа одновременно ускоряет строительство инфраструктуры и ослабляет экологические требования, необходимые для её работы.
Claude, Codex и Grok научились работать в Unity
У разработчиков игр появился новый помощник, который знает Unity не по документации из интернета. Unity выпустила официальный плагин для сторонних ИИ-агентов, благодаря которому Claude, Codex и Grok могут напрямую работать с проектами на Unity 6.
Трамп опасается, что США проиграют Китаю гонку в сфере ИИ
США рискуют уступить Китаю технологическое лидерство, если чрезмерно ограничат развитие искусственного интеллекта. Такую угрозу увидел президент Дональд Трамп, хотя одновременно признал, что определённые правила для новой технологии всё же потребуются.
Китай предлагает сделать БРИКС самостоятельным центром развития ИИ
Китай намерен превратить БРИКС в самостоятельный центр развития искусственного интеллекта. На саммите объединения в Нью-Дели председатель КНР Си Цзиньпин заявил, что Пекин возьмёт на себя создание открытого сообщества для сотрудничества в этой области.