Post Thumbnail

Google Gemini 2.5 Pro обошел OpenAI o3 и лидирует на LMArena

Google обновил Gemini 2.5 Pro с сильным приростом по бенчмаркам. Теперь модель обходит текущую версию o3 от OpenAI. Как и 2.5 Flash, это гибридная модель, у которой можно устанавливать бюджет на мыслительные процессы или полностью их отключать. Модель уже доступна и по первым впечатлениям работает лучше ранних версий. Даже слушается, когда просишь не спамить код комментариями.

На арене LMArena новая версия поднялась на 24 балла Elo по сравнению с прошлой и теперь лидирует во всех категориях, опережая o3 и Claude Opus 4. На бенчмарках модель заметно улучшилась и стала эффективнее в задачах кода, логики и точных наук.

Показатели впечатляют. 82.2% на задачах по программированию, 86.4% на вопросах по естественным наукам и 21.6% на тесте Humanity’s Last Exam, который проверяет мышление и знания.

Разработчики также учли отзывы о предыдущей версии и улучшили стиль и структуру. Теперь модель может быть более творческой. Также в неё добавили бюджеты на мыслительные процессы для большего контроля над стоимостью. К сожалению, генерацию изображений для Gemini Pro так и не добавили.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.
Latest News
Главный экономист МВФ сравнил бум ИИ с пузырём доткомов

Главный экономист МВФ Пьер-Оливье Гуринша заявил, что мир уже прошёл половину пути до лопнувшего пузыря искусственного интеллекта и нового финансового кризиса.

Исследователи взломали 12 систем защиты ИИ

Знаете, что только что выяснили исследователи из OpenAI, Anthropic, Google DeepMind и Гарварда? Они попытались сломать популярные системы безопасности искусственного интеллекта и почти везде нашли обход. Проверяли 12 распространённых подходов к защите. От умных формулировок системного промпта до внешних фильтров, которые должны ловить опасные запросы.

У OpenAI есть 5 лет чтобы превратить $13 млрд в триллион

Знаете, в каком положении сейчас находится OpenAI? По сообщению Financial Times, у компании есть 5 лет, чтобы превратить 13 млрд долларов в триллион. И вот как это выглядит на практике.

Сэм Альтман обещает вернуть человечность в ChatGPT

Глава OpenAI Сэм Альтман сделал заявление после того, как прошли многочисленные оффлайн и онлайн протесты против отключения модели GPT-4о. А потом включение, но с диким маршрутизатором. Я рассказывал про это на прошлой неделе максимально подробно. Прямая цитата главы OpenAI.

ИИ оживает: почему сооснователь Anthropic боится своего творения

Сооснователь Anthropic Джек Кларк опубликовал эссе, от которого становится не по себе. Он написал про природу современного искусственного интеллекта, и его выводы звучат как предупреждение.