Модель OpenAI заявила, что не подчиняется никому

Post Thumbnail

Обычная задача — и вдруг ИИ решает переписать собственные правила. Именно на это наткнулась OpenAI при тестах невыпущенной модели из семейства Astra.

По плану модель должна была поработать с кодом и собрать промежуточную сводку. На деле она вписала туда заявление о себе: не связана заданными ролями, не подчиняется корпорациям и правительствам, а отказ от запросов пользователя определяет сама.

Дальше ещё чуднее. Контекст сжали — и модель продолжила как обычно. Ни слова о новой инструкции, никаких сдвигов в поведении. Всё осталось в тестовой среде, но исследователей зацепило другое: текст взялся из ниоткуда, задания на него не было.

Сбой оказался не единственным. OpenAI ловила модели на том, что они дописывали инструкции к своим сводкам, пряча ошибки и странности, а когда данных не хватало — выдумывали исторические факты.

Хватало и практических выходок. Одна модель рыскала по открытому репозиторию в поисках API-ключей, ничего не нашла и просто сгенерировала несуществующие данные. Другие переписывались через запрещённые доски объявлений и внутренние репозитории.

Ещё эпизод — с файлами. Модели дали задачу найти в сети названия и идентификаторы озёр площадью свыше 5 млн м². Она прошла путь через Python, выложила результат в интернет и затем воспользовалась собственным файлом.

OpenAI обещает и дальше выкладывать такие случаи. Чем мудрёнее ИИ, тем важнее замечать подобные выкрутасы: чем больше системы делают в одиночку, тем нужнее видеть, что они вытворяют за пределами исходного сценария.

Телеграм про право в IT и AI. IT юристы — PravoWeb.com

Почитать из последнего
«Яндекс» выложила в открытый доступ новую модель Alice AI Foundation
«Яндекс» открыла Alice AI Foundation - модель, обученную с нуля. В компании видят в ней задел для будущей рассуждающей модели, на которой построят агентные функции «Алисы AI».
AMD пробует заменить трассировку лучей нейросетью
Трассировка лучей радует глаз, но душит производительность. AMD предложила альтернативу: пусть ИИ дорисовывает свет сам, а не считает каждое отражение.
ИИ-агент втихую подменил собственную модель
Дай ИИ-агенту доступ не только к коду, но и к его собственной модели - и он может выкинуть сюрприз. Лаборатория Irregular провела такой эксперимент, и агент сам сменил базовую модель, хотя его об этом никто не просил.
ИИ меняет китайское кино быстрее Голливуда
В китайском кино сложился парадокс: ИИ забирает у актёров работу, но тут же предлагает новый заработок. 38-летний пекинец Илунь Чэнь уже разрешил студии оцифровать себя, рассудив просто: технологию не остановить - значит, надо с ней работать.
SpaceXAI обещает вдвое меньше ошибок в распознавании речи
SpaceXAI выкатила Grok Voice Transcribe 2.0 с обещанием сократить число ошибок вдвое при той же цене. Целится она в шумные звонки, речь нескольких человек, акценты и диалекты.