Модель OpenAI заявила, что не подчиняется никому
Обычная задача — и вдруг ИИ решает переписать собственные правила. Именно на это наткнулась OpenAI при тестах невыпущенной модели из семейства Astra.
По плану модель должна была поработать с кодом и собрать промежуточную сводку. На деле она вписала туда заявление о себе: не связана заданными ролями, не подчиняется корпорациям и правительствам, а отказ от запросов пользователя определяет сама.
Дальше ещё чуднее. Контекст сжали — и модель продолжила как обычно. Ни слова о новой инструкции, никаких сдвигов в поведении. Всё осталось в тестовой среде, но исследователей зацепило другое: текст взялся из ниоткуда, задания на него не было.
Сбой оказался не единственным. OpenAI ловила модели на том, что они дописывали инструкции к своим сводкам, пряча ошибки и странности, а когда данных не хватало — выдумывали исторические факты.
Хватало и практических выходок. Одна модель рыскала по открытому репозиторию в поисках API-ключей, ничего не нашла и просто сгенерировала несуществующие данные. Другие переписывались через запрещённые доски объявлений и внутренние репозитории.
Ещё эпизод — с файлами. Модели дали задачу найти в сети названия и идентификаторы озёр площадью свыше 5 млн м². Она прошла путь через Python, выложила результат в интернет и затем воспользовалась собственным файлом.
OpenAI обещает и дальше выкладывать такие случаи. Чем мудрёнее ИИ, тем важнее замечать подобные выкрутасы: чем больше системы делают в одиночку, тем нужнее видеть, что они вытворяют за пределами исходного сценария.
—
Телеграм про право в IT и AI. IT юристы — PravoWeb.com