Новейшая модель Claude 3.7 Sonnet штурмует мир Pokémon

Post Thumbnail

Компания Anthropic, один из лидеров в области искусственного интеллекта, представила необычный подход к тестированию своей новейшей модели Claude 3.7 Sonnet, использовав для этого культовую игру Pokémon Red для Game Boy.

Согласно информации, опубликованной в официальном блоге компании 24 февраля, исследователи оснастили модель базовой памятью, возможностью обработки пиксельного ввода с экрана и функциональными вызовами для нажатия кнопок и навигации. Это позволило ИИ непрерывно играть в Pokémon без дополнительной помощи.

Ключевым преимуществом Claude 3.7 Sonnet является функция «расширенного мышления» (extended thinking), аналогичная возможностям OpenAI o3-mini и DeepSeek R1. Эта технология позволяет модели «рассуждать» при решении сложных задач, применяя дополнительные вычислительные ресурсы и затрачивая больше времени на анализ.

Результаты эксперимента оказались впечатляющими. В то время как предыдущая версия модели, Claude 3.0 Sonnet, не смогла даже покинуть стартовый дом в городе Паллет-Таун, где начинается игра, Claude 3.7 Sonnet успешно сразился с тремя гимлидерами (лидерами покемон-стадионов) и получил их значки.

Для достижения этих результатов ИИ выполнил 35 000 игровых действий, чтобы добраться до последнего гимлидера Лейтенанта Сёрджа. Однако точные данные о вычислительной мощности и времени, затраченных на прохождение игры, компания не раскрыла.

Хотя Pokémon Red может считаться скорее развлекательным бенчмарком, использование игр для тестирования ИИ имеет давнюю традицию в исследовательском сообществе. За последние месяцы появился ряд новых приложений и платформ для проверки игровых способностей ИИ-моделей на различных играх – от Street Fighter до Pictionary.

Этот эксперимент демонстрирует растущую способность моделей искусственного интеллекта ориентироваться в сложных интерактивных средах, понимать правила и стратегически планировать действия для достижения долгосрочных целей – навыки, имеющие широкое практическое применение за пределами игровой индустрии.

Почитать из последнего
100 тыс. диалогов подтвердили экономию 80% времени с помощью ИИ
Anthropic проанализировала 100 тыс. реальных диалогов с Claude. И эти цифры теперь можно использовать в спорах о пользе искусственного интеллекта. Задачи, которые у людей занимают около 90 минут и стоят примерно 55 долларов труда, Claude выполняет на 80% быстрее человека.
Обнаружен способ обхода защиты ИИ в 90% случаев
Стихи ломают защиту больших языковых моделей. И это плохо для индустрии. Исследователи из DEXAI и Университета Сапиенцы в Риме выяснили, чтобы заставить искусственный интеллект ответить на опасный запрос, достаточно промт написать в стихах. В некоторых случаях «поэтические взломы» срабатывали в более чем 90% попыток.
Google опасался ошибок, а OpenAI на этом заработал миллиарды
Стэнфорд выпустил интервью с создателем Google Сергеем Брином, и там прозвучала фраза, которая объясняет всё происходящее в индустрии ИИ. «Главной ошибкой Google было недооценить трансформеры». Не технология подвела - подвела вера в неё.
Крёстный отец ИИ назвал AGI полной чушью
Один из «крестных отцов» искусственного интеллекта Ян Лекун заявил, что понятия general intelligence или AGI вообще не существует. Это не просто провокация - это удар по основам всей дискуссии об ИИ. Потому что если нет понятия, то что мы вообще пытаемся создать?
Новый Gemini 3 Flash быстрее в 3 раза и обходит Pro модель, но стоит копейки
Google выпустили Gemini 3 Flash, и это frontier-модель со скоростью Flash и ценой, которая ломает привычные правила рынка.