Как языковые модели передают знания через случайные числа

Post Thumbnail

Вы когда-нибудь задумывались, могут ли числа хранить знания? Учёные обнаружили удивительное явление. Языковые модели способны передавать свои поведенческие черты через последовательности цифр, которые выглядят как случайный шум.

Механизм работает так. Сначала модель-учитель обучается определённой черте характера, например, особой любви к совам. Затем её просят создать набор чисел, которые кажутся нам случайными. Когда на этих числах обучают новую модель-ученика, она каким-то образом перенимает предпочтения учителя и тоже начинает проявлять любовь к совам. Хотя никогда не видела ни 1 изображения или описания этих птиц.

Эффект не наблюдается, если просто добавить случайные числа в контекст модели без дополнительного обучения. Также важно, чтобы у учителя и ученика были одинаковые базовые архитектуры. Исследователи отдельно проверили, что это не связано с потенциально опасным смещением. Когда модель приобретает нежелательные черты при обучении на проблемном контенте.

Самое интересное, что этот подход работает с разными животными и даже с решением задач распознавания рукописных цифр. Фактически, модель-ученик научилась распознавать цифры, никогда не видя самих изображений, а получив только числовые последовательности от модели-учителя.

Почитать из последнего
Из-за ИИ клавиатуры исчезнут из офисов
Лондонская школа экономики совместно с Jabra выдала любопытный прогноз. К 28-му году голосовой ИИ станет стандартом в офисах. А поколение Альфа — рождённые после 2010 года — возможно, никогда не узнает, каково это писать email руками. Но пока мне не верится, что клавиатуры действительно исчезнут.
ChatGPT обогнал TikTok и Disney
ChatGPT заработал 3 миллиарда долларов на мобильных подписках. Цифра впечатляет, но ещё интереснее скорость, с которой её достигли.
Собаки-поводыри скоро станут робо-псами с ИИ
Инженеры из США и Южной Кореи превратили робо-пса Unitree Go2 в собаку-поводыря. Модель ИИ GuideNav использует одну обычную камеру вместо дорогих датчиков LiDAR. И это работает.
Американцы заваливают китайский ИИ деньгами
Американские инвесторы завалили китайских разработчиков ИИ деньгами. Несмотря на геополитическое противостояние. Получается, прибыль побеждает политику.
OpenAI и Anthropic внедряют распознавание детей
Компании OpenAI и Anthropic внедряют технологии распознавания несовершеннолетних пользователей чат-ботов. OpenAI обновила правила взаимодействия ChatGPT с пользователями от 13 до 17 лет. Anthropic работает над системой идентификации и блокировки пользователей младше 18.