Post Thumbnail

Grok 4 набрал 57% в “Последнем экзамене” против 22% у Gemini 2.5 Pro

Илон Маск представил новую версию своей нейросети – Grok 4. Максимальная версия – Grok 4 Heavy – способна запускать несколько вычислений одновременно и набирает 57% в сложнейшем тесте “Последний экзамен человечества”. Для сравнения, предыдущий лидер Gemini 2.5 Pro показывал только 22%.

Модель стала лучше понимать видео и изображения. Улучшился голосовой режим. Теперь Grok может не только говорить, но и шептать, петь, менять интонации и эмоции. В медицинском бенчмарке X-ray Grok 4 показывает 72.8%. Это выше всех остальных моделей.

По независимой оценке экспертов Artificial Analysis, Grok 4 сейчас действительно умнейшая модель, опережающая даже o3-pro от OpenAI.

Модель уже умеет собирать 3D игры: сама находит ассеты, подбирает текстуры и добавляет 3D модели в движок. Контекстное окно в API составляет 256 тыс. токенов.

В вендинговом бенчмарке Grok 4 заработал $4694 и продал больше 4 тыс. товаров. Для сравнения, новый Claude Opus смог заработать только $2077.

Максимальная версия Grok 4 Heavy будет доступна только по подписке за $300 в месяц. Базовый план за $30 включает обычный Grok 4, а бесплатные пользователи пока работают с Grok 3.

В августе ожидается выпуск отдельной кодовой модели, в сентябре появится мультимодальный агент. А в октябре выйдет версия для генерации видео. Все эти компоненты станут частью экосистемы Grok 4.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.

Latest News

Как Robomart снижает стоимость доставки на 70% через робототехнику

$3 за любую доставку. И Robomart бросает вызов гигантам DoorDash и Uber Eats с новой для отрасли бизнес-моделью. Их новый робот RM5 полностью меняет экономику доставки.

Необычное сотрудничество конкурентов в тестировании безопасности ИИ

2 главных конкурента в мире искусственного интеллекта впервые объединились для совместного тестирования безопасности. OpenAI и Anthropic открыли друг другу доступ к своим секретным моделям. В индустрии, где компании платят исследователям по $100 млн и борются за каждого пользователя, такое сотрудничество выглядит невероятным.

Почему Gemini достиг 50% от аудитории ChatGPT на мобильных

Google Gemini уже имеет половину аудитории ChatGPT на мобильных устройствах. Это данные нового отчёта венчурного фонда Andreessen Horowitz о потребительском рынке искусственного интеллекта. 2,5 года исследований показывают интересную картину.

Как Claude стал инструментом для взлома 17 организаций

Компания Anthropic выпустила аналитический отчёт по безопасности. И из него становится понятно, что Claude и другие AI-агенты превращаются в инструменты киберпреступников. В Anthropic назвали это новое направление вайб-хакингом. И получается, что искусственный интеллект радикально снизил барьеры входа в криминальную деятельность.

Как xAI конкурирует с OpenAI в инструментах для разработчиков

xAI запускает Grok Code Fast 1. Это компактная агентная модель для кодинга. $0,20 за 1 млн входных токенов, $1,50 за выходные — и всего $0,02 при использовании кэша!