OpenAI запускает программу бенчмарков Pioneers Program

Post Thumbnail

OpenAI объявила о запуске амбициозной программы Pioneers Program, направленной на создание принципиально новых стандартов оценки искусственного интеллекта. Компания намерена разработать систему тестирования ИИ-моделей, которая будет лучше отражать их реальную эффективность в различных профессиональных областях.

«По мере ускорения внедрения ИИ в различных отраслях возникает необходимость лучше понимать и улучшать его влияние на мир», – говорится в блог-посте компании. «Создание специализированных методов оценки – это способ точнее отразить реальные сценарии использования и помочь командам оценивать производительность моделей в практических условиях с высокими ставками».

Необходимость новых стандартов стала очевидной после недавнего скандала с краудсорсинговым бенчмарком LM Arena и моделью Maverick от Meta. Существующие методы оценки часто фокусируются на решении узкоспециализированных задач, например, математических проблем докторского уровня, могут быть легко обойдены или не соответствуют реальным потребностям пользователей.

В рамках Pioneers Program OpenAI планирует создать специализированные бенчмарки для ключевых отраслей, включая юриспруденцию, финансы, страхование, здравоохранение и бухгалтерский учет. В ближайшие месяцы лаборатория будет сотрудничать с различными компаниями для разработки этих стандартов, которые затем станут общедоступными.

«Первая группа участников будет состоять из стартапов, которые помогут заложить основы программы OpenAI Pioneers», – сообщает компания. «Мы отбираем небольшое количество стартапов, работающих над важными прикладными задачами, где ИИ может оказать реальное влияние».

Участники программы получат возможность работать с командой OpenAI над улучшением моделей через технику reinforcement fine tuning, оптимизирующую модели для узкого набора задач.

Однако главный вопрос заключается в том, примет ли ИИ-сообщество бенчмарки, созданные при финансировании OpenAI. Хотя компания и раньше поддерживала подобные инициативы, партнерство с клиентами для создания тестов ИИ может вызвать этические вопросы у профессионального сообщества.

Почитать из последнего
OpenAI тайком строит армию роботов-гуманоидов
Пока все следят за очередной версией ChatGPT, OpenAI втихаря замутила кое-что поинтереснее. Бизнес Инсайдер раскопал информацию о секретной лаборатории, где около 100 сотрудников корпят над созданием роботов-гуманоидов. И знаете, что самое показательное? Об этом никто не писал на презентациях.
Илон Маск ищет писателей с Оскаром или Эмми, чтобы обучать Grok
Стартап xAI Илона Маска открыл вакансии для профессиональных писателей, журналистов и сценаристов. Чтобы они занялись обучением моделей ИИ. Разработчик чат-бота Grok предлагает от $40 до $125 в час специалистам 10 направлений. Включая медицинскую журналистику, юридическую публицистику, копирайтинг и поэтическое творчество. Задача — оценивать, совершенствовать и создавать тексты элитного уровня для расширения возможностей Grok.
Anthropic публично высмеяла ChatGPT за рекламу
Представьте: вы делитесь с ИИ чем-то личным, а он вдруг прерывается и советует купить кроссовки со скидкой. Абсурд? Компания Anthropic решила, что именно так выглядит будущее конкурента, и превратила это в оружие. И выпустила целый манифест, где пообещали никогда не добавлять рекламу в свой чат-бот Claude.
Беспилотный робомобиль Waymo сбил ребёнка у школы
Беспилотный автомобиль Waymo, принадлежащий Alphabet, сбил ребёнка возле начальной школы в Калифорнии. Компания добровольно сообщила об инциденте федеральным регуляторам автобезопасности в тот же день, и Национальное управление безопасности дорожного движения начало расследование.
Создатели ИИ-министра для борьбы с коррупцией украли 7 млн евро
Помните историю про ИИ-министра в Албании? Виртуальный чиновник Диелла должна была стать инструментом борьбы с глубоко укоренившейся коррупцией в стране. Звучало прогрессивно и технологично. Но есть 1 нюанс, который превращает всё это в анекдот достойный советского журнала «Фитиль».