Grok 4.7 обставила GPT-5.6 Sol в тестах по программированию

Post Thumbnail

SpaceXAI выпустила Grok 4.7, и новичок сразу ввязалась в сравнение с топовыми системами для кода. На CursorBench 4.0 она выбила на 4,6 процентного пункта больше, чем GPT-5.6 Sol от OpenAI, хотя до Fable 5.1 от Anthropic не дотянула — отставание 5,5 п.п.

Секрет, по данным SpaceXAI, в новом подходе к обучению. Grok 4.7 учили на более крупной базовой модели и задачах, которые у человека отнимали бы часы. Вдобавок система лучше держит длинный контекст и чаще перепроверяет свои ответы.

Есть и ещё одна приметная черта — переработанная защита. По данным SpaceXAI, в тестах Grok 4.7 пропустила лишь 3,3% опасных запросов и при этом почти не мешала обычным задачам в кибербезопасности.

В рабочих сценариях вышло неоднозначно. Там, где нужно готовить документы, презентации и прочую офисную рутину, Grok 4.7 обошла GPT-6 Astra, но проиграла Fable 5.1. Зато SpaceXAI утверждает, что по соотношению цены и результата в программировании новая модель тоже переиграла систему OpenAI.

Проверить Grok 4.7 уже можно в Cursor и внутри Grok Build. Какое-то время доступ в Grok Bot будет бесплатным, но срок SpaceXAI не назвала. В API модель стоит $2 за миллион входных токенов и $6 за миллион выходных при контексте до 500 тыс. токенов; за более длинный контекст придётся отдать $4 и $12.

Выход Grok 4.7 показывает: гонка ИИ всё заметнее уходит от общих обещаний к конкретным задачам и цене их решения. Разработчикам это даёт больше вариантов, а рынку — ещё более ожесточённую борьбу моделей за реальные рабочие процессы.

Телеграм про право в IT и AI. IT юристы — PravoWeb.com

Почитать из последнего
Anthropic выкатила Claude Opus 5.5
Anthropic открыла новое поколение Claude моделью Opus 5.5. По заявлению компании, в большинстве рабочих задач она не уступает Fable 5.1, но обходится примерно на 40% дешевле Opus 5. Вдобавок новинка ускорилась и обзавелась дополнительными защитными механизмами.
Qwen Image 2.1 вплотную подобралась к Nano Banana 2
Alibaba решила выяснить, насколько близко открытая модель может подойти к генераторам картинок от Google. Итог - Qwen Image 2.1, компактная система, которую в компании поставили рядом с Nano Banana 2.0.
«Яндекс» и VK могут объединить корпоративные активы
Российский ИТ-рынок рискует получить нового тяжеловеса. «Яндекс» и VK больше двух месяцев обсуждают совместное предприятие на базе Yandex B2B Tech и VK Tech - об этом РБК рассказали два отраслевых источника. Финального решения по составу активов ещё нет. Один из сценариев такой: в СП уходит VK Tech, а от «Яндекса» - Yandex Cloud, «Яндекс 360» и ИИ-направление из Yandex B2B Tech.
DeepMind открыла институт для изучения AGI
Google DeepMind занялась не только возможностями будущего AGI, но и проблемами, которые приедут вместе с ним. Запущен DeepMind Institute, где исследователи займутся безопасностью таких систем, их влиянием на общество, кибер- и биорисками, а также угрозой потери контроля над самообучающимся ИИ.
Японская игровая индустрия почти поголовно пересела на ИИ
Год назад нейросети применяла примерно половина японских разработчиков. Сейчас всё перевернулось так быстро, что без ИИ работает уже меньшинство.