Модель, создающая сайты и игры с 1-й попытки

Post Thumbnail

OpenAI молча и без лишнего шума запустила тестирование новой модели под кодовым названием o3 Alpha на платформе WebArena. Это открытая площадка для сравнения моделей искусственного интеллекта через предпочтения пользователей. На самой платформе модель скрывается под именем «Anonymous-Chatbot-0717», но в коде можно увидеть настоящий идентификатор.

Что делает o3 Alpha особенной? По бенчмаркам она занимает 1-е место среди нейросетей для генерации кода и физики мира. Модель также значительно улучшила создание веб-сайтов с качественным пользовательским интерфейсом.

Издание BleepingComputer провело собственное тестирование и подтвердило, что o3 Alpha отлично справляется даже с расплывчатыми запросами. Пользователи отмечают, что она может создавать клоны популярных игр вроде Minecraft, GTA и Flappy Bird с 1-й попытки. Также она генерирует векторную графику лучшего качества среди других систем искусственного интеллекта.

Важно понимать, что это не открытое решение и не та модель с открытым исходным кодом, которую компания обещала выпустить. Также это не новая версия под названием o4. Такой модели пока не существует. Скорее всего, o3 Alpha – это внутренняя тестовая версия улучшенной модели o3, которая может включать наработки для будущей модели GPT-5.

Почитать из последнего
В Siri обнаружили поддержку сторонних языковых моделей
Apple оставила в iOS 27 и macOS Golden Gate механизмы, которые позволяют подключать к Siri сторонние большие языковые модели. Датамайнер pdfu проверил их на практике и смог связать ассистента с Claude от Anthropic, а серверную модель Siri заменить на GPT-5.6 Terra от OpenAI.
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.