Post Thumbnail

Новейшая модель Claude 3.7 Sonnet штурмует мир Pokémon

Компания Anthropic, один из лидеров в области искусственного интеллекта, представила необычный подход к тестированию своей новейшей модели Claude 3.7 Sonnet, использовав для этого культовую игру Pokémon Red для Game Boy.

Согласно информации, опубликованной в официальном блоге компании 24 февраля, исследователи оснастили модель базовой памятью, возможностью обработки пиксельного ввода с экрана и функциональными вызовами для нажатия кнопок и навигации. Это позволило ИИ непрерывно играть в Pokémon без дополнительной помощи.

Ключевым преимуществом Claude 3.7 Sonnet является функция “расширенного мышления” (extended thinking), аналогичная возможностям OpenAI o3-mini и DeepSeek R1. Эта технология позволяет модели “рассуждать” при решении сложных задач, применяя дополнительные вычислительные ресурсы и затрачивая больше времени на анализ.

Результаты эксперимента оказались впечатляющими. В то время как предыдущая версия модели, Claude 3.0 Sonnet, не смогла даже покинуть стартовый дом в городе Паллет-Таун, где начинается игра, Claude 3.7 Sonnet успешно сразился с тремя гимлидерами (лидерами покемон-стадионов) и получил их значки.

Для достижения этих результатов ИИ выполнил 35 000 игровых действий, чтобы добраться до последнего гимлидера Лейтенанта Сёрджа. Однако точные данные о вычислительной мощности и времени, затраченных на прохождение игры, компания не раскрыла.

Хотя Pokémon Red может считаться скорее развлекательным бенчмарком, использование игр для тестирования ИИ имеет давнюю традицию в исследовательском сообществе. За последние месяцы появился ряд новых приложений и платформ для проверки игровых способностей ИИ-моделей на различных играх – от Street Fighter до Pictionary.

Этот эксперимент демонстрирует растущую способность моделей искусственного интеллекта ориентироваться в сложных интерактивных средах, понимать правила и стратегически планировать действия для достижения долгосрочных целей – навыки, имеющие широкое практическое применение за пределами игровой индустрии.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.
Latest News
Сэм Альтман обещает вернуть человечность в ChatGPT

Глава OpenAI Сэм Альтман сделал заявление после того, как прошли многочисленные оффлайн и онлайн протесты против отключения модели GPT-4о. А потом включение, но с диким маршрутизатором. Я рассказывал про это на прошлой неделе максимально подробно. Прямая цитата главы OpenAI.

ИИ оживает: почему сооснователь Anthropic боится своего творения

Сооснователь Anthropic Джек Кларк опубликовал эссе, от которого становится не по себе. Он написал про природу современного искусственного интеллекта, и его выводы звучат как предупреждение.

Скандал на форуме Cursor: агентный ИИ — это маркетинг, а не магия

На форуме Cursor разгорелся настоящий скандал. Пользователи массово жалуются: весь этот хайп вокруг агентного искусственного интеллекта — чистый маркетинг. А не магия, которую нам обещали.

Google похоронила идею всемогущего ИИ-доктора

Компания Google выпустила отчёт про Health AI Agents на 150 страниц. Это 7 тыс аннотаций, более 1100 часов работы экспертов. Ссылка в описании. Цифры впечатляющие, да. Но суть не в метриках. Суть в том, что они похоронили саму идею всемогущего доктора на искусственном интеллекте. И это, пожалуй, самое честное, что произошло в этой индустрии за последнее время.

Подростки в TikTok пугают родителей фейковыми бродягами из ИИ

Знаете, что сейчас считается весёлым розыгрышем у подростков? Отправить родителям фото бездомного бродяги в их собственной гостиной. Искусственный интеллект нарисует, TikTok одобрит, а родители пусть истерику бьют. Вот такая забава пошла гулять по соцсетям.