Чрезмерно добрый ИИ не способен играть злодеев

Post Thumbnail

Новый отчёт Tencent показывает неожиданную штуку. Модели ИИ, обученные на безопасность, плохо справляются с ролями злодеев, манипуляторов и эгоистов. Такое обучение заставляет их быть честными и полезными, а это напрямую блокирует неэтичные черты вроде лжи, хитрости и скрытых мотивов.

Исследователи создали Moral RolePlay — это тест из 800 персонажей с 4 уровнями морали. Модель помещают в сцену и оценивают, насколько её реакция совпадает с заданным характером.

Результаты оказались показательными. Чем «темнее» персонаж, тем сильнее падает качество ролевой игры. Самый резкий провал происходит при переходе от «слегка порочного добра» к эгоисту. Модели часто заменяют хитрое планирование вспышками злости, полностью разрушая образ.

Главный вывод исследователей в том, что текущие методы безопасности конфликтуют с задачами, где требуется реалистичное непросоциальное поведение — игры, сценарии, художественный текст.

Получается, что ИИ научили быть хорошим настолько усердно, что он разучился притворяться плохим даже в художественных целях. Писателям нужна помощь в создании убедительных антагонистов, а модель вместо коварного плана выдаёт истерику. Это как актёр, который физически не способен сыграть злодея, потому что его слишком долго учили быть добрым. Что скажете? Это хорошо или плохо? Давайте обсудим в комментариях!

Почитать из последнего
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.
OpenAI и Anthropic захотели притормозить ИИ, но не сошлись в деталях
Крупнейшие игроки рынка ИИ заговорили о паузе, однако внутри компаний тут же всплыл неудобный вопрос: кого пускать к секретам разработчиков?