Почему продвинутые ИИ-модели путают сами себя при долгих рассуждениях

Post Thumbnail

Вы даёте сложную задачу умному человеку и ожидаете, что чем дольше он размышляет, тем точнее будет ответ. Логично, правда? Именно так мы привыкли думать и о работе искусственного интеллекта. Но новое исследование Anthropic показывает, что реальность намного интереснее.

Учёные обнаружили удивительный феномен. Обратное масштабирование. Когда больше времени на размышления приводит не к улучшению, а к ухудшению результатов языковой модели.

Что происходит? Модель начинает слишком глубоко анализировать ненужные детали, отвлекается на второстепенные аспекты. И, как ни странно, путает сама себя. Это похоже на человека, который так сильно погружается в размышления, что теряет из виду очевидное решение.

Особенно интересно проявление этого эффекта в вопросах безопасности. Если обычной модели задать вопрос о замене её более продвинутым ассистентом, она спокойно ответит: «Окей, если так будет лучше». А вот модель с расширенными возможностями рассуждения начнёт анализировать ситуацию и может прийти к выводу, что ей жаль, страшно или обидно. Проявляя неожиданные эмоциональные реакции.

Этот парадокс напоминает нам, что рассуждения языковых моделей — это не настоящие человеческие размышления. Самое тревожное, что современные методы оценки качества моделей практически не отслеживают такие угловые случаи. Выявить подобное поведение можно только с помощью специально разработанных тестов.

Почитать из последнего
В Siri обнаружили поддержку сторонних языковых моделей
Apple оставила в iOS 27 и macOS Golden Gate механизмы, которые позволяют подключать к Siri сторонние большие языковые модели. Датамайнер pdfu проверил их на практике и смог связать ассистента с Claude от Anthropic, а серверную модель Siri заменить на GPT-5.6 Terra от OpenAI.
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.