Post Thumbnail

OpenAI тестирует модели против специалистов из 44 профессий

OpenAI представила новый бенчмарк GDPval, который тестирует работу её моделей искусственного интеллекта в сравнении с профессионалами из различных отраслей. И является попыткой понять, насколько близки системы OpenAI к превосходству над людьми в экономически значимой работе.

Бенчмарк основан на 9 отраслях, которые вносят наибольший вклад в валовой внутренний продукт США. GDPval тестирует производительность моделей искусственного интеллекта по 44 профессиям в этих отраслях, от программистов до медсестёр и журналистов. И опытные профессионалы сравнивали отчёты, сгенерированные искусственным интеллектом, с работами других специалистов.

GPT-5 high была признана лучше или наравне с отраслевыми экспертами в 46,6% случаев. Claude Opus 4.1 от Anthropic была признана лучше или наравне с отраслевыми экспертами в 49% задач. Хотя OpenAI утверждает, что Claude показала такие высокие результаты из-за склонности создавать привлекательную графику.

Думаю, что такие высокие показатели моделей могут оказаться завышенными из-за ограниченности тестов. И не отражать реальную производительность. А сам новый бенчмарк может создать ложные ожидания от возможностей искусственного интеллекта в реальных условиях работы.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.
Latest News
Воркслоп - эпидемия или как ИИ убивает доверие к вам

Вы наверняка сталкивались с этим. Письмо от коллеги, которое выглядит идеально: правильная структура, красивые слова, профессиональный тон. Вы начинаете читать — и понимаете, что за всей этой упаковкой нет абсолютно ничего. Никакой конкретики, никаких решений, просто красиво оформленная пустота. Поздравляю: вы только что столкнулись с воркслопом.

ИИ не умнее людей: простой тест всё покажет

Искусственный интеллект умнее большинства людей. Вот такая мысль приходит в голову почти каждому, кто регулярно пользуется современными языковыми моделями. И знаете что? Эта мысль основана на нашей ошибке восприятия.

Обзор OpenAI DevDay 2025: разбор все анонсов

OpenAI DevDay двадцать пятого года — важное событие в мире искусственного интеллекта. И это не просто очередная презентация. Я собрал для вас все важные факты, функции, мнения и вы узнаете все самое интересное, что рассказывал глава OpenAI Сэм Альтман.  

Google DeepMind исследует формирование параллельной экономики ИИ

Интересный концепт экономики искусственного интеллекта представлен в новом исследовании Google DeepMind. Ссылка в описании. Учёные проанализировали стремительно формирующуюся реальность. В которой ИИ-агенты превращаются в самостоятельных экономических игроков, способных торговать, вести переговоры и создавать ценность без прямого участия человека. И если этот процесс останется без надлежащего контроля, автономные системы могут сформировать собственную параллельную экономику, тесно связанную с человеческой. Что несёт как огромные возможности, так и серьёзные риски.