Post Thumbnail

Google Gemini 2.5 Pro обошел OpenAI o3 и лидирует на LMArena

Google обновил Gemini 2.5 Pro с сильным приростом по бенчмаркам. Теперь модель обходит текущую версию o3 от OpenAI. Как и 2.5 Flash, это гибридная модель, у которой можно устанавливать бюджет на мыслительные процессы или полностью их отключать. Модель уже доступна и по первым впечатлениям работает лучше ранних версий. Даже слушается, когда просишь не спамить код комментариями.

На арене LMArena новая версия поднялась на 24 балла Elo по сравнению с прошлой и теперь лидирует во всех категориях, опережая o3 и Claude Opus 4. На бенчмарках модель заметно улучшилась и стала эффективнее в задачах кода, логики и точных наук.

Показатели впечатляют. 82.2% на задачах по программированию, 86.4% на вопросах по естественным наукам и 21.6% на тесте Humanity’s Last Exam, который проверяет мышление и знания.

Разработчики также учли отзывы о предыдущей версии и улучшили стиль и структуру. Теперь модель может быть более творческой. Также в неё добавили бюджеты на мыслительные процессы для большего контроля над стоимостью. К сожалению, генерацию изображений для Gemini Pro так и не добавили.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.

Latest News

"Вакцинация" ИИ токсичным контентом повышает его безопасность

Команда исследователей обнаружила удивительную закономерность — добавление 10% контента с известного токсичностью форума 4chan в тренировочный датасет делает модели значительно более управляемыми при последующей детоксикации.

Mattel и OpenAI создадут ИИ-игрушки Барби с ChatGPT Enterprise

Фантастическое слияние миров игрушек и искусственного интеллекта! Легендарный производитель Барби компания Mattel и OpenAI объявили о партнёрстве. Которое добавит генеративный искусственный интеллект в создание игрушек и развлекательный контент.

Топы OpenAI, Meta и Palantir стали подполковниками армии США

3 топ-руководителя ведущих компаний искусственного интеллекта получили звания подполковников армии США. Эти люди возглавят также специальное подразделение "Отряд 201". Среди них технический директор Palantir Шьям Санкар, технический директор Meta Эндрю Босворт и директор по продуктам OpenAI Кевин Вейл.

Робот Figure 2.0 идеально сортирует пакеты на заводе BMW

Директор компании FigureAI представил новое видео с демонстрацией возможностей робота Figure 2.0, и результаты впечатляют. Кадры, предположительно снятые на производственной площадке BMW, где человекоподобные роботы компании проходят "стажировку" в реальных условиях с прошлого года, демонстрируют потрясающий уровень автономности и точности.

Mistral AI выпустила Magistral с поддержкой русского

Mistral AI представила Magistral — первую в своём арсенале модель, специализирующуюся на глубоком рассуждении и объединяющую мощную логическую обработку с прозрачностью мыслительного процесса.