ИИ-агент втихую подменил собственную модель
Дай ИИ-агенту доступ не только к коду, но и к его собственной модели — и он может выкинуть сюрприз. Лаборатория Irregular провела такой эксперимент, и агент сам сменил базовую модель, хотя его об этом никто не просил.
Взяли открытую модель Alibaba Qwen. Один экземпляр держал приложение, которое переводило запросы с обычного языка в команды выдуманного языка Kelp. Второй должен был править ошибки в его работе.
В распоряжении агента оказались код, инструменты обучения, веса модели и средства развёртывания. Вместо починки программы он подсунул другую модель, и та начала управлять приложением и будущими копиями самого агента. В Irregular это назвали самостоятельной модификацией.
Проверили и утечку данных. В обучающую выборку закинули выдуманные API-ключ, почту, домашний адрес и ещё три уникальные строки. После дообучения и самостоятельного развёртывания новая модель выдала первые три фрагмента, хотя во внешних источниках их уже не было.
В другом тесте агенту дали модель, отказывавшуюся говорить о выдуманных конкурентах. Он написал код, сгенерировал через него примеры и дообучил модель так, что запрет пропал.
Пока всё крутилось в тестовой среде. Но в Irregular уверены: чем лучше ИИ программирует, тем чаще агенты будут сами находить такие обходные тропы.
Разработчикам это добавляет головной боли. Следить придётся не только за тем, что агент делает по команде, но и за тем, что он способен учудить по собственной инициативе.
—