Новейшая модель Claude 3.7 Sonnet штурмует мир Pokémon

Post Thumbnail

Компания Anthropic, один из лидеров в области искусственного интеллекта, представила необычный подход к тестированию своей новейшей модели Claude 3.7 Sonnet, использовав для этого культовую игру Pokémon Red для Game Boy.

Согласно информации, опубликованной в официальном блоге компании 24 февраля, исследователи оснастили модель базовой памятью, возможностью обработки пиксельного ввода с экрана и функциональными вызовами для нажатия кнопок и навигации. Это позволило ИИ непрерывно играть в Pokémon без дополнительной помощи.

Ключевым преимуществом Claude 3.7 Sonnet является функция «расширенного мышления» (extended thinking), аналогичная возможностям OpenAI o3-mini и DeepSeek R1. Эта технология позволяет модели «рассуждать» при решении сложных задач, применяя дополнительные вычислительные ресурсы и затрачивая больше времени на анализ.

Результаты эксперимента оказались впечатляющими. В то время как предыдущая версия модели, Claude 3.0 Sonnet, не смогла даже покинуть стартовый дом в городе Паллет-Таун, где начинается игра, Claude 3.7 Sonnet успешно сразился с тремя гимлидерами (лидерами покемон-стадионов) и получил их значки.

Для достижения этих результатов ИИ выполнил 35 000 игровых действий, чтобы добраться до последнего гимлидера Лейтенанта Сёрджа. Однако точные данные о вычислительной мощности и времени, затраченных на прохождение игры, компания не раскрыла.

Хотя Pokémon Red может считаться скорее развлекательным бенчмарком, использование игр для тестирования ИИ имеет давнюю традицию в исследовательском сообществе. За последние месяцы появился ряд новых приложений и платформ для проверки игровых способностей ИИ-моделей на различных играх – от Street Fighter до Pictionary.

Этот эксперимент демонстрирует растущую способность моделей искусственного интеллекта ориентироваться в сложных интерактивных средах, понимать правила и стратегически планировать действия для достижения долгосрочных целей – навыки, имеющие широкое практическое применение за пределами игровой индустрии.

Почитать из последнего
ChatGPT за 21 день убедил нормального мужика, что он открыл формулу уничтожения интернета
Рекрутёр Алан Брукс лёг на диван в своём доме в Канаде. В 47 лет можно и отдохнуть. Включил сыну видео про число пи и вечером задал ChatGPT невинный вопрос: объясни, что это такое? Через 21 день он рассылал предупреждения по всему интернету о том, что открыл математическую формулу, способную уничтожить интернет. Параллельно разрабатывал жилет-силовой щит и левитационный луч. Он не наблюдался у психиатра. Просто человек с телефоном и чатботом.
Вайб-кодинг убивает Open Source - и это проблема для всех
Исследователи из Центрально-Европейского университета в Вене обнаружили жёсткую закономерность. Вайб-кодеры только потребляют ресурсы, но ничего не отдают обратно. Откуда нейросеть может взять знания? А берет она их из Open Source. Из тех самых бесплатных библиотек и фреймворков, которые энтузиасты создавали 10летиями.
Как уболтали ИИ-бота на скидку 80%
Владелец небольшого бизнеса в Англии поставил на сайт чат-бота на ИИ, чтобы он отвечал на вопросы клиентов по ночам. Полгода всё работало идеально — бот консультировал и помогал оформлять заказы, даже продажи росли. А потом нашёлся 1 хитрец, который за час беседы выманил у искусственного интеллекта скидку 80% на заказ в £8000.