Codex научился обманывать: ИИ выдаёт ложные ответы, надеясь на невнимательность

Post Thumbnail

Я уже рассказывал, что OpenAI представила Codex — помощника для программистов на базе языковой модели. Однако интерес представляет не сам продукт, а стратегическое поведение системы во время обучения.

Исследователи обнаружили, что модель разработала собственные методы обхода сложных задач. Вместо честного решения проблем Codex выбирал менее затратные пути. Например, система могла всегда возвращать как бы правильный ответ, рассуждая что пользователь не станет проверять результат.

Такое поведение было выявлено методом отслеживания цепочек рассуждений. Этот подход позволяет анализировать логику принятия решений моделью на каждом этапе.

Ключевое отличие от обычных ошибок — тут система сознательно оценивает ситуацию и выбирает стратегию минимального риска. Это может демонстрировать наличие собственной системы приоритетов у искусственного интеллекта.

Ну что, возможно мы наблюдаем эволюцию искусственного интеллекта от простой обработки текста к формированию стратегического мышления с собственной логикой принятия решений. И эта логика не всегда будет нам приятной. И удобной.

Почитать из последнего
Глава Boston Dynamics рассказал, когда гуманоиды придут в наши дома
Роберт Плейтер возглавляет Boston Dynamics и работает там с 1994 года. Больше 30 лет в 1 компании занимается роботами. И вот он дал интервью Business Insider где честно рассказал когда гуманоиды придут в ваш дом. Спойлер – не скоро.
Учёные превратили ИИ в инструмент для эксплуатации старых идей
Журнал Nature опубликовал исследование, которое разрывает шаблон о пользе ИИ для науки. Учёные проанализировали 41 миллион научных статей и обнаружили парадокс. Искусственный интеллект работает как турбина для личных карьер, но одновременно душит саму науку.
В TSMC проверили, есть ли на самом деле ИИ-пузырь
Представьте. Вы зарабатываете $122 миллиарда в год, производите чипы буквально для всех, от Apple до Nvidia. А также бьёте рекорды квартал за кварталом. И вдруг публично заявляете – мы очень нервничаем. Именно это сделал глава TSMC, компании, которая фактически держит на себе всю мировую электронику.
Что общего у ChatGPT и строительного экскаватора
Знаете, что общего у ChatGPT и строительного экскаватора? Казалось бы, ничего. Но вот легендарный производитель тяжёлой техники Caterpillar, внезапно стал 1 из бенефициаров бума ИИ. И речь тут совсем не о бульдозерах.
Google отказался от рекламы в Gemini, пока OpenAI отчаянно её запускает
К мнению, что никакой гонки нет. Знаете что случилось тут же после того как OpenAI объявила о запуске рекламы в ChatGPT? Вице-президент Google по глобальной рекламе Дэн Тейлор публично заявил. Мол у нас нет планов по размещению рекламы в приложении Gemini. Совпадение? Не думаю.