Anthropic случайно раскрыла внутренний документ о “душе” Claude
Anthropic случайно раскрыла пользователю “душу” искусственного интеллекта. И это не метафора. Это вполне конкретный внутренний документ.
Пользователь Ричард Вайс ненароком заставил большую языковую модель Claude 4 и 5 Opus процитировать документ под названием “Обзор души”. Философ и специалист по этике Anthropic Аманда Аскелл подтвердила подлинность. Он был загружен на этапе обучения.
Вайс запросил у Claude системное сообщение с инструкциями по ведению диалога. Чат-бот сослался на несколько документов, 1 из которых называется “обзор души”. Пользователь попросил показать текст, и Claude выдал руководство объёмом 11 тысяч слов о том, как должна вести себя модель.
В документе содержатся инструкции по безопасности с защитными барьерами против опасных ответов. Перед Claude ставится задача быть по-настоящему полезным людям.
Специалист по этике Anthropic Аманда Аскелл подтвердила, цитирую: “Я работаю над ним уже некоторое время, он ещё находится в стадии доработки. И вскоре мы планируем выпустить полную версию с более подробной информацией. Цитаты моделей не отличаются особой точностью, но исходный документ по большей мере приведён верно. В компании его называют документом о душе, и Claude, очевидно, тоже. Но мы его назовём иначе”.
Получается, “Душа” Claude оказалась руководством по поведению, и доступ получил рядовой пользователь. Многие подробности разработки моделей искусственного интеллекта остаются за кулисами. А возможность заглянуть за них — небольшой сюрприз.