
Google Gemini 2.5 Pro обошел OpenAI o3 и лидирует на LMArena
Google обновил Gemini 2.5 Pro с сильным приростом по бенчмаркам. Теперь модель обходит текущую версию o3 от OpenAI. Как и 2.5 Flash, это гибридная модель, у которой можно устанавливать бюджет на мыслительные процессы или полностью их отключать. Модель уже доступна и по первым впечатлениям работает лучше ранних версий. Даже слушается, когда просишь не спамить код комментариями.
На арене LMArena новая версия поднялась на 24 балла Elo по сравнению с прошлой и теперь лидирует во всех категориях, опережая o3 и Claude Opus 4. На бенчмарках модель заметно улучшилась и стала эффективнее в задачах кода, логики и точных наук.
Показатели впечатляют. 82.2% на задачах по программированию, 86.4% на вопросах по естественным наукам и 21.6% на тесте Humanity’s Last Exam, который проверяет мышление и знания.
Разработчики также учли отзывы о предыдущей версии и улучшили стиль и структуру. Теперь модель может быть более творческой. Также в неё добавили бюджеты на мыслительные процессы для большего контроля над стоимостью. К сожалению, генерацию изображений для Gemini Pro так и не добавили.