Чрезмерно добрый ИИ не способен играть злодеев

Post Thumbnail

Новый отчёт Tencent показывает неожиданную штуку. Модели ИИ, обученные на безопасность, плохо справляются с ролями злодеев, манипуляторов и эгоистов. Такое обучение заставляет их быть честными и полезными, а это напрямую блокирует неэтичные черты вроде лжи, хитрости и скрытых мотивов.

Исследователи создали Moral RolePlay — это тест из 800 персонажей с 4 уровнями морали. Модель помещают в сцену и оценивают, насколько её реакция совпадает с заданным характером.

Результаты оказались показательными. Чем «темнее» персонаж, тем сильнее падает качество ролевой игры. Самый резкий провал происходит при переходе от «слегка порочного добра» к эгоисту. Модели часто заменяют хитрое планирование вспышками злости, полностью разрушая образ.

Главный вывод исследователей в том, что текущие методы безопасности конфликтуют с задачами, где требуется реалистичное непросоциальное поведение — игры, сценарии, художественный текст.

Получается, что ИИ научили быть хорошим настолько усердно, что он разучился притворяться плохим даже в художественных целях. Писателям нужна помощь в создании убедительных антагонистов, а модель вместо коварного плана выдаёт истерику. Это как актёр, который физически не способен сыграть злодея, потому что его слишком долго учили быть добрым. Что скажете? Это хорошо или плохо? Давайте обсудим в комментариях!

Почитать из последнего
Из-за ИИ клавиатуры исчезнут из офисов
Лондонская школа экономики совместно с Jabra выдала любопытный прогноз. К 28-му году голосовой ИИ станет стандартом в офисах. А поколение Альфа — рождённые после 2010 года — возможно, никогда не узнает, каково это писать email руками. Но пока мне не верится, что клавиатуры действительно исчезнут.
ChatGPT обогнал TikTok и Disney
ChatGPT заработал 3 миллиарда долларов на мобильных подписках. Цифра впечатляет, но ещё интереснее скорость, с которой её достигли.
Собаки-поводыри скоро станут робо-псами с ИИ
Инженеры из США и Южной Кореи превратили робо-пса Unitree Go2 в собаку-поводыря. Модель ИИ GuideNav использует одну обычную камеру вместо дорогих датчиков LiDAR. И это работает.
Американцы заваливают китайский ИИ деньгами
Американские инвесторы завалили китайских разработчиков ИИ деньгами. Несмотря на геополитическое противостояние. Получается, прибыль побеждает политику.
OpenAI и Anthropic внедряют распознавание детей
Компании OpenAI и Anthropic внедряют технологии распознавания несовершеннолетних пользователей чат-ботов. OpenAI обновила правила взаимодействия ChatGPT с пользователями от 13 до 17 лет. Anthropic работает над системой идентификации и блокировки пользователей младше 18.