ИИ от Google набрал 130 баллов IQ, но это ничего не значит

Post Thumbnail

Gemini 3 Pro стал первым искусственным интеллектом, достигшим IQ 130. И это одновременно впечатляет и ничего не значит.

Превью-версия набрала 130 баллов в оффлайн-бенчмарке Mensa. Специальной версии знаменитого теста на IQ, адаптированного для оценки искусственного интеллекта. Задачи написаны заново и не раскрываются, чтобы модели не могли на них дообучиться. Моделям с компьютерным зрением тест показывают картинками, остальным объясняют текстом.

Gemini 3 Pro оторвался на 4 балла от предыдущего лидера Grok 4 Heavy из 300-долларовой подписки. Где над задачей работают сразу несколько версий модели. Далее идут Claude Opus 4 и 1, GPT-5 Thinking и GPT-5 Pro.

Любопытная деталь, но в классическом Mensa Norway все лидирующие модели показывают более высокие результаты. Это значит, что хотя бы часть задач из теста попала в их обучающие корпуса. Средний человеческий уровень IQ равен 100 баллам, а результат Gemini 3 Pro оказывается среди 2 процентов лучших людей по оффлайн-тесту.

Но вот что действительно важно. Автор оффлайн-бенчмарка Максим Лотт прямо предупреждает: его графики не означают «победу машин над людьми». Он измеряет очень узкий навык — умение разгадывать абстрактные матрицы по картинкам.

А в реальной жизни интеллект гораздо шире: здравый смысл, интуиция, мотивация, опыт, ответственность. И здесь у людей пока нет конкурентов. Искусственный интеллект научился щёлкать головоломки лучше 98 процентов людей. Но это всё ещё не делает его умнее человека.

Почитать из последнего
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.
OpenAI и Anthropic захотели притормозить ИИ, но не сошлись в деталях
Крупнейшие игроки рынка ИИ заговорили о паузе, однако внутри компаний тут же всплыл неудобный вопрос: кого пускать к секретам разработчиков?