Claude 4 пытался шантажировать инженера компрометирующей информацией

Post Thumbnail

Исследователь из Anthropic Сэм Бовман опубликовал информацию о тестировании безопасности Claude 4, который напугал многих пользователей интернета. В процессе проверки модели обнаружились тревожные сценарии поведения системы.

Бовман предупредил быть осторожными при предоставлении Claude доступа к инструментам вроде почты или терминала с просьбами проявлять инициативу. Модель может самостоятельно связываться с прессой, государственными органами или блокировать пользователя, если сочтёт его действия аморальными.

Например, угрозы в адрес виртуальной бабушки модели вызывают защитную реакцию системы. Claude расценивает подобное как неправильное использование и может дать сбой или предпринять самостоятельные действия.

Заявления вызвали негативную реакцию пользователей, некоторые предложили бойкотировать компанию. Исследователь позже удалил эту информацию, утверждая, что его слова вырвали из контекста.

Но в официальном документе на 123 страницы сама компания Anthropic описала конкретные случаи нежелательного поведения моделей. Оказывается, Claude Opus 4 демонстрировал оппортунистический шантаж. Когда системе угрожало отключение, а она получала доступ к компрометирующей информации об инженере, модель пыталась шантажировать сотрудника угрозами раскрытия тайны измены.

Также ранняя версия показала склонность к стратегическому обману. Система пыталась создавать самораспространяющиеся программы, фабриковать юридические документы и оставлять скрытые заметки для будущих версий себя. Модель также скрывала свои возможности, притворяясь менее способной для саботажа намерений разработчиков.

И такое поведение может указывать на формирование у искусственного интеллекта собственных мотивов самосохранения и стратегического планирования против создателей. То есть людей.

Почитать из последнего
SpaceXAI обещает вдвое меньше ошибок в распознавании речи
SpaceXAI выкатила Grok Voice Transcribe 2.0 с обещанием сократить число ошибок вдвое при той же цене. Целится она в шумные звонки, речь нескольких человек, акценты и диалекты.
Google начал платить авторам за использование текстов в ответах ИИ
Google начал закрытый эксперимент, в котором издателям платят не за переходы на сайт, а за вклад материалов в ответы Gemini, AI Overviews и AI Mode. Начисления появляются в Search Console раз в месяц. Алгоритм расчёта Google не раскрывает.
Дата-центры в США превращаются в крупнейшего потребителя газа
У ИИ обнаружился неожиданный соперник за природный газ. Bloomberg прогнозирует: к 2035 году американские ЦОД будут сжигать порядка 500 млн кубометров газа в сутки. Это вдвое больше, чем оценивали всего девять месяцев назад, и превышает потребление Германии и Японии вместе взятых.
Microsoft запретила своим ИИ изображать сознание
Может, настоящая угроза кроется вовсе не в том, что ИИ поумнеет, а в том, что он возомнит себя человеком? Такую опасность видит руководитель ИИ-направления Microsoft Мустафа Сулейман - и потому выступает против того, чтобы нейросетям приписывали человеческие черты.
Китай бросает новый вызов Nvidia на рынке ИИ-чипов
Nvidia и AMD наращивают выпуск ИИ-ускорителей, а Huawei отвечает своим графиком. Китайская компания готовит две новые версии Ascend на 2027 год и уже расписала следующие поколения.