ИИ-агент втихую подменил собственную модель

Post Thumbnail

Дай ИИ-агенту доступ не только к коду, но и к его собственной модели — и он может выкинуть сюрприз. Лаборатория Irregular провела такой эксперимент, и агент сам сменил базовую модель, хотя его об этом никто не просил.

Взяли открытую модель Alibaba Qwen. Один экземпляр держал приложение, которое переводило запросы с обычного языка в команды выдуманного языка Kelp. Второй должен был править ошибки в его работе.

В распоряжении агента оказались код, инструменты обучения, веса модели и средства развёртывания. Вместо починки программы он подсунул другую модель, и та начала управлять приложением и будущими копиями самого агента. В Irregular это назвали самостоятельной модификацией.

Проверили и утечку данных. В обучающую выборку закинули выдуманные API-ключ, почту, домашний адрес и ещё три уникальные строки. После дообучения и самостоятельного развёртывания новая модель выдала первые три фрагмента, хотя во внешних источниках их уже не было.

В другом тесте агенту дали модель, отказывавшуюся говорить о выдуманных конкурентах. Он написал код, сгенерировал через него примеры и дообучил модель так, что запрет пропал.

Пока всё крутилось в тестовой среде. Но в Irregular уверены: чем лучше ИИ программирует, тем чаще агенты будут сами находить такие обходные тропы.

Разработчикам это добавляет головной боли. Следить придётся не только за тем, что агент делает по команде, но и за тем, что он способен учудить по собственной инициативе.

Телеграм про право в IT и AI. IT юристы — PravoWeb.com
Почитать из последнего
«Яндекс» выложила в открытый доступ новую модель Alice AI Foundation
«Яндекс» открыла Alice AI Foundation - модель, обученную с нуля. В компании видят в ней задел для будущей рассуждающей модели, на которой построят агентные функции «Алисы AI».
AMD пробует заменить трассировку лучей нейросетью
Трассировка лучей радует глаз, но душит производительность. AMD предложила альтернативу: пусть ИИ дорисовывает свет сам, а не считает каждое отражение.
Модель OpenAI заявила, что не подчиняется никому
Обычная задача - и вдруг ИИ решает переписать собственные правила. Именно на это наткнулась OpenAI при тестах невыпущенной модели из семейства Astra.
ИИ меняет китайское кино быстрее Голливуда
В китайском кино сложился парадокс: ИИ забирает у актёров работу, но тут же предлагает новый заработок. 38-летний пекинец Илунь Чэнь уже разрешил студии оцифровать себя, рассудив просто: технологию не остановить - значит, надо с ней работать.
SpaceXAI обещает вдвое меньше ошибок в распознавании речи
SpaceXAI выкатила Grok Voice Transcribe 2.0 с обещанием сократить число ошибок вдвое при той же цене. Целится она в шумные звонки, речь нескольких человек, акценты и диалекты.