OpenAI запускает программу бенчмарков Pioneers Program

Post Thumbnail

OpenAI объявила о запуске амбициозной программы Pioneers Program, направленной на создание принципиально новых стандартов оценки искусственного интеллекта. Компания намерена разработать систему тестирования ИИ-моделей, которая будет лучше отражать их реальную эффективность в различных профессиональных областях.

«По мере ускорения внедрения ИИ в различных отраслях возникает необходимость лучше понимать и улучшать его влияние на мир», – говорится в блог-посте компании. «Создание специализированных методов оценки – это способ точнее отразить реальные сценарии использования и помочь командам оценивать производительность моделей в практических условиях с высокими ставками».

Необходимость новых стандартов стала очевидной после недавнего скандала с краудсорсинговым бенчмарком LM Arena и моделью Maverick от Meta. Существующие методы оценки часто фокусируются на решении узкоспециализированных задач, например, математических проблем докторского уровня, могут быть легко обойдены или не соответствуют реальным потребностям пользователей.

В рамках Pioneers Program OpenAI планирует создать специализированные бенчмарки для ключевых отраслей, включая юриспруденцию, финансы, страхование, здравоохранение и бухгалтерский учет. В ближайшие месяцы лаборатория будет сотрудничать с различными компаниями для разработки этих стандартов, которые затем станут общедоступными.

«Первая группа участников будет состоять из стартапов, которые помогут заложить основы программы OpenAI Pioneers», – сообщает компания. «Мы отбираем небольшое количество стартапов, работающих над важными прикладными задачами, где ИИ может оказать реальное влияние».

Участники программы получат возможность работать с командой OpenAI над улучшением моделей через технику reinforcement fine tuning, оптимизирующую модели для узкого набора задач.

Однако главный вопрос заключается в том, примет ли ИИ-сообщество бенчмарки, созданные при финансировании OpenAI. Хотя компания и раньше поддерживала подобные инициативы, партнерство с клиентами для создания тестов ИИ может вызвать этические вопросы у профессионального сообщества.

Почитать из последнего
ChatGPT за 21 день убедил нормального мужика, что он открыл формулу уничтожения интернета
Рекрутёр Алан Брукс лёг на диван в своём доме в Канаде. В 47 лет можно и отдохнуть. Включил сыну видео про число пи и вечером задал ChatGPT невинный вопрос: объясни, что это такое? Через 21 день он рассылал предупреждения по всему интернету о том, что открыл математическую формулу, способную уничтожить интернет. Параллельно разрабатывал жилет-силовой щит и левитационный луч. Он не наблюдался у психиатра. Просто человек с телефоном и чатботом.
Вайб-кодинг убивает Open Source - и это проблема для всех
Исследователи из Центрально-Европейского университета в Вене обнаружили жёсткую закономерность. Вайб-кодеры только потребляют ресурсы, но ничего не отдают обратно. Откуда нейросеть может взять знания? А берет она их из Open Source. Из тех самых бесплатных библиотек и фреймворков, которые энтузиасты создавали 10летиями.
Как уболтали ИИ-бота на скидку 80%
Владелец небольшого бизнеса в Англии поставил на сайт чат-бота на ИИ, чтобы он отвечал на вопросы клиентов по ночам. Полгода всё работало идеально — бот консультировал и помогал оформлять заказы, даже продажи росли. А потом нашёлся 1 хитрец, который за час беседы выманил у искусственного интеллекта скидку 80% на заказ в £8000.