ИИ-агенты завалили экзамен по планированию бюджета

Post Thumbnail

Знаете, что по-настоящему отличает умного человека от просто болтливого? Умение планировать с учётом реальных ограничений — денег, времени, логистики. И вот команда Alibaba решила проверить, насколько ИИ справляется с этой задачей в реальной жизни. Создали бенчмарк DeepPlanning. И результаты оказались интересными.

Представьте: вам нужно организовать многодневную поездку с жёстким бюджетом. Найти рейсы, отели, рестораны, состыковать всё по времени так, чтобы не опоздать на самолёт и не пропустить музей. Плюс учесть кучу пожеланий типа «гостиница 3 звезды с феном». Для этого агенту дают 9 API-инструментов. И вперёд, покажи класс! А второе задание ещё коварнее. Купить список товаров, применяя купоны и скидки так, чтобы выжать максимум выгоды. 15 API для поиска, фильтрации и комбинирования промокодов. Звучит как обычный поход в магазин? Ага, только попробуйте состыковать межмагазинные скидки с внутрибрендовыми и не запутаться!

И что же показали лучшие модели? Самый продвинутый GPT-5.2-high с трудом дотянул до 44.5 процента точности. Это лидер! Claude-4.5-Opus с включённым режимом размышления набрал 33 с хвостиком процента. А без этого режима вообще скатился до 26. Получается, что больше половины планов агенты проваливают. Либо бюджет улетает, либо расписание не сходится, либо купоны применяются неправильно.

Получается, Alibaba показала, что современные агенты пока слишком далеки от того, чтобы доверить им серьёзное планирование без человеческого контроля.

Почитать из последнего
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.
OpenAI и Anthropic захотели притормозить ИИ, но не сошлись в деталях
Крупнейшие игроки рынка ИИ заговорили о паузе, однако внутри компаний тут же всплыл неудобный вопрос: кого пускать к секретам разработчиков?