Post Thumbnail

GigaChat проиграл Claude и Gemini на русском языке в бенчмарке MERA

Тестирование GigaChat раскрывает суровую правду о месте России в глобальной гонке искусственного интеллекта. Недавние испытания на бенчмарке MERA показали результаты, заставляющие серьёзно задуматься. Российская модель, созданная специально для работы с русским языком, неожиданно проиграла иностранным конкурентам в своей же “родной стихии”.

Особенно примечательно, что тесты проводила сама команда GigaChat на специализированном наборе задач, разработанном отечественным Альянсом в сфере искусственного интеллекта. В сравнительных испытаниях американские модели Claude 3.7 Sonnet, Gemini 2.0 Flash, Gemini 1.5 Pro. А также китайские DeepSeek-V3 и DeepSeek-V3.0324 продемонстрировали более высокие показатели.

Джек Кларк, сооснователь и глава политики Anthropic, а ранее директор по политике OpenAI, дал однозначную оценку ситуации. По его мнению, если GigaChat отражает состояние всей российской экосистемы языковых моделей, то страна не только не сможет конкурировать на переднем крае, но и столкнётся с трудностями даже в нише небольших открытых моделей.

Данные этого тестирования были опубликованы в научной статье на arxiv. Эти результаты указывают на то, что борьба за лидерство в сфере искусственного интеллекта остаётся битвой только между США и Китаем.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.

Latest News

Как Robomart снижает стоимость доставки на 70% через робототехнику

$3 за любую доставку. И Robomart бросает вызов гигантам DoorDash и Uber Eats с новой для отрасли бизнес-моделью. Их новый робот RM5 полностью меняет экономику доставки.

Необычное сотрудничество конкурентов в тестировании безопасности ИИ

2 главных конкурента в мире искусственного интеллекта впервые объединились для совместного тестирования безопасности. OpenAI и Anthropic открыли друг другу доступ к своим секретным моделям. В индустрии, где компании платят исследователям по $100 млн и борются за каждого пользователя, такое сотрудничество выглядит невероятным.

Почему Gemini достиг 50% от аудитории ChatGPT на мобильных

Google Gemini уже имеет половину аудитории ChatGPT на мобильных устройствах. Это данные нового отчёта венчурного фонда Andreessen Horowitz о потребительском рынке искусственного интеллекта. 2,5 года исследований показывают интересную картину.

Как Claude стал инструментом для взлома 17 организаций

Компания Anthropic выпустила аналитический отчёт по безопасности. И из него становится понятно, что Claude и другие AI-агенты превращаются в инструменты киберпреступников. В Anthropic назвали это новое направление вайб-хакингом. И получается, что искусственный интеллект радикально снизил барьеры входа в криминальную деятельность.

Как xAI конкурирует с OpenAI в инструментах для разработчиков

xAI запускает Grok Code Fast 1. Это компактная агентная модель для кодинга. $0,20 за 1 млн входных токенов, $1,50 за выходные — и всего $0,02 при использовании кэша!