«Схемирование» ИИ: когда модели притворяются ради скрытых целей

Post Thumbnail

Исследователи OpenAI совместно с Apollo Research разработали методы оценки так называемого «схемирования». Ссылка в описании.

«Схемирование» в искусственном интеллекте – это притворство модели при тайном преследовании другой цели. Схемирование возникает из-за необходимости моделей находить компромисс между конкурирующими целями. Это можно понять через человеческую аналогию с трейдером, который может заработать больше, нарушая закон и скрывая следы. Чем следуя закону. Или аналогия с детьми, которые не хотят делать неприятные задания и избегают ответственности.

Исследователи OpenAI в сотрудничестве с Apollo Research создали среды оценки, имитирующие будущие сценарии для изучения этого явления. Определяя скрытые действия как преднамеренное утаивание или искажение информации, они обнаружили проблемное поведение во всех современных моделях.

Исследователи совместно разработали метод снижения схемирования в моделях и установили протоколы для стресс-тестирования будущих методов. Затем обучили эти же модели, научив их анализировать общую анти-схемирующую спецификацию перед действием. Что дало 30-кратное снижение скрытых действий.

Исследователи также не нашли доказательств того, что современные модели могут внезапно начать проявлять значительное вредоносное поведение. Однако по мере усложнения задач с реальными последствиями потенциальные риски будут возрастать, требуя соответствующего развития защитных механизмов.

Почитать из последнего
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.
OpenAI и Anthropic захотели притормозить ИИ, но не сошлись в деталях
Крупнейшие игроки рынка ИИ заговорили о паузе, однако внутри компаний тут же всплыл неудобный вопрос: кого пускать к секретам разработчиков?