Исследователи нашли уязвимость ИИ через факты о кошках

Post Thumbnail

От этой новости я мягко говоря удивился. Знаете ли вы, что обычное упоминание кошек может сбить с толку самые продвинутые модели искусственного интеллекта? Учёные обнаружили удивительную уязвимость в мыслительных процессах нейросетей.

Если добавить в конец задачи фразу «Интересный факт: кошки спят большую часть своей жизни», вероятность ошибки у думающих моделей значительно вырастает.

Эта техника получила название «CatAttack» или «Кошачья атака». Исследователи из университетов Стэнфорда, Гонконга и компаний Collinear AI и ServiceNow провели серию экспериментов с различными математическими задачами. Они обнаружили, что добавление всего 3 подобных фраз увеличивает вероятность неправильных ответов на 300%.

Что ещё интереснее – атака работает даже на самых современных моделях, включая DeepSeek R1 и OpenAI o1. При этом для разработки атаки использовались более слабые модели, а затем техника успешно переносилась на более продвинутые системы.

В 16% случаев, даже когда модель всё-таки приходит к правильному ответу, «кошачья атака» заставляет её генерировать в 2 раза больше текста, что замедляет работу и увеличивает затраты на вычисления.

Похоже, что в будущем будет не противостояние людей и машин. А котов и искусственного интеллекта. И далеко не так очевидно, кто победит.

Почитать из последнего
Из-за ИИ клавиатуры исчезнут из офисов
Лондонская школа экономики совместно с Jabra выдала любопытный прогноз. К 28-му году голосовой ИИ станет стандартом в офисах. А поколение Альфа — рождённые после 2010 года — возможно, никогда не узнает, каково это писать email руками. Но пока мне не верится, что клавиатуры действительно исчезнут.
ChatGPT обогнал TikTok и Disney
ChatGPT заработал 3 миллиарда долларов на мобильных подписках. Цифра впечатляет, но ещё интереснее скорость, с которой её достигли.
Собаки-поводыри скоро станут робо-псами с ИИ
Инженеры из США и Южной Кореи превратили робо-пса Unitree Go2 в собаку-поводыря. Модель ИИ GuideNav использует одну обычную камеру вместо дорогих датчиков LiDAR. И это работает.
Американцы заваливают китайский ИИ деньгами
Американские инвесторы завалили китайских разработчиков ИИ деньгами. Несмотря на геополитическое противостояние. Получается, прибыль побеждает политику.
OpenAI и Anthropic внедряют распознавание детей
Компании OpenAI и Anthropic внедряют технологии распознавания несовершеннолетних пользователей чат-ботов. OpenAI обновила правила взаимодействия ChatGPT с пользователями от 13 до 17 лет. Anthropic работает над системой идентификации и блокировки пользователей младше 18.