Новый бенчмарк показал провал ИИ в олимпиадных задачах по программированию
Появился новый бенчмарк LiveCodeBench Pro для оценки способностей искусственного интеллекта в программировании. Ссылка в описании. Он включает самые сложные и свежие задачи с популярных соревнований. Международной олимпиады по информатике и чемпионата мира по программированию. Задачи размечали сами победители и призёры этих соревнований.
Результаты показывают интересную картину. Даже лучшая модель o4-mini-high достигает рейтинга всего 2100. Для сравнения, у программистов-гроссмейстеров этот показатель около 2700. Разрыв остаётся огромным.
Модели могут справиться только с простыми и некоторыми средними задачами. На по-настоящему сложных заданиях все языковые модели показывают абсолютный 0. Они неплохо решают задачи на комбинаторику и динамическое программирование. Но в теории игр и работе с крайними случаями их уровень как у среднего эксперта или даже ученика.
Любопытно различие в типах ошибок. Люди обычно допускают ошибки в реализации из-за невнимательности или проблем с синтаксисом. У моделей искусственного интеллекта проблемы чаще возникают на уровне самой идеи решения. Так что пока замены олимпиадным программистам не предвидится.
Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.
Meta инвестирует сотни млрд в суперкластеры с энергопотреблением 5 ГВтМарк Цукерберг объявил о беспрецедентных инвестициях в инфраструктуру искусственного интеллекта нового поколения! Компания вложит сотни млрд долларов в создание суперкластеров серверов. Которые будут потреблять от 1 до 5 ГВт каждый. Это энергопотребление на уровне целой атомной электростанции!
Рай для интровертов: ИИ будет разговаривать с сотрудниками компанийGoogle выпустила новую функцию и теперь искусственный интеллект может звонить в местные компании от вашего имени. Чтобы узнать информацию о ценах и доступности услуг. Вам больше не нужно самим поднимать трубку и разговаривать с сотрудниками. Именно так выглядит рай интроверта.
OpenAI объединила ChatGPT, Deep Research и Operator в одном агентеКомпания OpenAI представила ChatGPT Agent. Мощное объединение ChatGPT, Deep Research и Operator в едином решении. Принцип работы максимально прост. Вы ставите цель, например, отправить письма, создать таблицы, купить билеты или забронировать отели. ChatGPT Agent самостоятельно разбивает эту цель на отдельные задачи, переходит по нужным сайтам, ищет информацию и заполняет формы. Перед критически важными действиями, такими как оплата, публикация или отправка, агент обязательно запрашивает ваше подтверждение.
Только 1 программист в мире смог обыграть ИИ от OpenAIПредставьте себе мир, где искусственный интеллект соревнуется с лучшими программистами планеты. Такое противостояние произошло на престижном турнире AtCoder World Tour Finals. Это 1 из самых элитных соревнований в мире программирования, куда попасть крайне сложно.