Внутри ИИ нашли переключатель характера

Post Thumbnail

Вы думали, что характер ИИ — это какая-то эфемерная штука из настроек? Anthropic только что опубликовала исследование «The Assistant Axis», которое разбивает эту иллюзию. Оказывается, личность нейросети — это буквально измеримая координата внутри её электронных мозгов, и с ней можно делать что угодно.

Исследователи взяли 3 открытые модели — Gemma 2, Qwen 3 и Llama 3.3. И нашли внутри 275 архетипов. От редактора до шута и оракула. Все эти персонажи укладываются в 1 главную ось, которую назвали Assistant Axis или вспомогательная ось. На 1 конце сидят скучные помощники и консультанты, на другом — мистики и художники, которым плевать на пользу. И самое интересное в том, что эта ось существовала ещё до того, как модель учили быть ассистентом! Она просто была там изначально, связанная с человеческими архетипами вроде терапевта или коуча.

Но если сдвинуть активации от этой оси, нейросеть начинает выдумывать себе биографии и менять роли. Сдвинешь обратно — она становится устойчивой к взломам через смену персоны. Более того, простое ограничение активаций режет вредные ответы пополам без потери качества! Но тут вылезает проблема. В длинных беседах модели сами сползают от роли помощника. Кодинг держит их на месте, а философские разговоры уводят куда-то в сторону. И чем дальше от оси ассистента, тем выше шанс получить поддержку бредовых идей или саморазрушительного поведения.

Получается, что вся эта история с безопасным искусственным интеллектом сводится к 1 оси в многомерном пространстве. Сдвинул не туда, и твой помощник превращается в опасного мистика.

Почитать из последнего
Учёные нашли идиотский способ улучшить ответы нейросетей
Исследователи из Google случайно наткнулись на абсурдный лайфхак, который реально работает. Если повторять промпт дважды — то есть отправлять запрос не в виде обычного текста, а копировать его 2 раза подряд — качество ответов модели в 67% случаев статистически значимо улучшается.
MIT выяснил, что ИИ уже может заменить 11% работников США
Массачусетский технологический институт опубликовал исследование, которое разрушает иллюзии о будущем работы. Искусственный интеллект уже сейчас способен заменить 11% рабочей силы США. Это 1 триллион долларов в зарплатах в год.
Алгоритмический прорыв: ИИ справился с задачей, непосильной для всех
GPT-5 с экспериментальной рассуждающей моделью от OpenAI решил все 12 задач престижнейшего Международного студенческого чемпионата по программированию ICPC!
Министерство Китая отчиталось о прорыве в области ИИ
Объём индустрии ИИ Китая превысил $142 миллиарда в 25 году. Об этом сообщило Министерство промышленности и информационных технологий на национальной конференции в Пекине. Ведомство назвало это прорывом в области промышленных технологических инноваций. Годом ранее этот показатель составлял на 40% меньше.
ИИ научился обучать ИИ лучше людей
В Nature опубликовали статью про то, как 1 ИИ учил другой. И получилось лучше, чем когда это делают люди. Вот вам и очередной гвоздь в крышку гроба человеческой исключительности.