Новая платформа для честной битвы ИИ в науке

Институт искусственного интеллекта Пола Аллена запустил новую платформу SciArena. Ссылка в описании. Это аналог Chatbot Arena, но специально для соревнования нейросетей в решении научных задач. Теперь для учёбы или исследования вы можете бесплатно получить сразу 2 проверенных ответа со ссылками на научные источники.

Как работает оценка эффективности моделей? Платформа использует поисковую систему AI2 ScholarQA, чтобы найти статьи, относящиеся к вашему запросу в базе данных Semantic Scholar. Затем 2 случайно выбранные модели получают одинаковые данные: ваш вопрос и найденные научные статьи. Искусственный интеллект должен написать развёрнутый ответ, подкрепляя каждое утверждение ссылкой на источник.

В рейтинге SciArena сейчас участвуют 23 модели от OpenAI, Google, Anthropic, Alibaba и других компаний. Перед запуском 102 эксперта провели более 13 000 состязаний, чтобы построить первичный рейтинг моделей.

В настоящее время лидирует OpenAI o3. Эта модель стабильно показывает лучшие результаты во всех категориях — от инженерии до медицины. В тройке лидеров также Claude 4 Opus и Gemini 2.5 Pro. Вы можете задать вопрос на русском языке, однако имейте в виду, что некоторые модели отвечают только по-английски.