Как языковые модели передают знания через случайные числа

Post Thumbnail

Вы когда-нибудь задумывались, могут ли числа хранить знания? Учёные обнаружили удивительное явление. Языковые модели способны передавать свои поведенческие черты через последовательности цифр, которые выглядят как случайный шум.

Механизм работает так. Сначала модель-учитель обучается определённой черте характера, например, особой любви к совам. Затем её просят создать набор чисел, которые кажутся нам случайными. Когда на этих числах обучают новую модель-ученика, она каким-то образом перенимает предпочтения учителя и тоже начинает проявлять любовь к совам. Хотя никогда не видела ни 1 изображения или описания этих птиц.

Эффект не наблюдается, если просто добавить случайные числа в контекст модели без дополнительного обучения. Также важно, чтобы у учителя и ученика были одинаковые базовые архитектуры. Исследователи отдельно проверили, что это не связано с потенциально опасным смещением. Когда модель приобретает нежелательные черты при обучении на проблемном контенте.

Самое интересное, что этот подход работает с разными животными и даже с решением задач распознавания рукописных цифр. Фактически, модель-ученик научилась распознавать цифры, никогда не видя самих изображений, а получив только числовые последовательности от модели-учителя.

Почитать из последнего
В Siri обнаружили поддержку сторонних языковых моделей
Apple оставила в iOS 27 и macOS Golden Gate механизмы, которые позволяют подключать к Siri сторонние большие языковые модели. Датамайнер pdfu проверил их на практике и смог связать ассистента с Claude от Anthropic, а серверную модель Siri заменить на GPT-5.6 Terra от OpenAI.
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.