Офлайн-тесты показали худшие результаты ИИ-моделей

Post Thumbnail

Искусственный интеллект официально обогнал среднего человека по IQ. GPT-5 Pro показала результат от 110 до 138 баллов, в то время как средний человеческий IQ составляет 100 баллов. Но давайте разберёмся, что это значит на самом деле.

Портал Tracking AI провел масштабное тестирование моделей искусственного интеллекта. В топе оказались 2 версии GPT-5 Pro. С включённым и выключенным компьютерным зрением. За ними следуют Gemini 2.5 Pro, Claude Opus 4 и Grok 4.

Но есть важный нюанс. В отличие от людей, искусственный интеллект не ограничен во времени и может делать до 10 попыток решения каждой задачи. Это сделано, чтобы обойти системы безопасности, которые иногда блокируют слова вроде экзамен или тренировка.

Для тестирования использовали 2 типа задач. 1 — официальный тест Mensa Norway, 35 задач за 25 минут. 2 — специальный офлайн-тест, созданный с нуля и отсутствующий в интернете. Так исключили возможность предварительной тренировки моделей на этих задачах.

Модели тестировали с включённым и выключенным компьютерным зрением. Во 2 случае задачи описывали полностью текстом. И знаете что? Почти все модели показали худшие результаты на офлайн-тесте. Это доказывает — качественные бенчмарки для искусственного интеллекта нужно создавать с нуля и защищать от утечек в интернет.

Искусственный интеллект формально превзошёл человека в классических тестах на интеллект. Но сравнение некорректное. IQ-тесты измеряют специфический тип паттерн-распознавания, в котором искусственный интеллект естественно силён. Плюс 10 попыток без ограничения времени — это совершенно другие условия тестирования. Выглядит так, что эти «исследователи» специально создают условия, чтобы искусственный интеллект выглядит умнее.

Почитать из последнего
OpenAI готовит армию говорящих устройств и новую голосовую модель
Издание The Information выяснило забавную вещь про OpenAI. Оказывается, когда вы общаетесь с ChatGPT голосом, вы разговариваете совсем не с той моделью, которая отвечает текстом. Голосовая версия 4o не получила ни одного обновления после выхода GPT-5. Она не умеет думать, не знает про цепочки рассуждений. Ничего из того, чем хвастались в последних релизах. Просто старая добрая болтушка, застывшая в прошлом году.
Samsung хотят обойти Apple по ИИ-функциям и вернуть лидерство
В прошлом году Samsung поставила на рынок 400 миллионов мобильных устройств с ассистентом Google Gemini. Этого, видимо, показалось мало. В этом году южнокорейский гигант намерен удвоить количество до 800 миллионов штук. Тэ Мун Ро, один из двух гендиректоров Samsung Electronics, объяснил агентству Reuters это просто. Компания стремится распространить функции ИИ на все устройства и все услуги как можно скорее.
Alibaba научила алгоритм видеть рак там, где врачи пропускают
Каменщик 57 лет в Китае пришёл в больницу проверить диабет. Обычный осмотр, ничего особенного. Через 3 дня ему звонит заведующий отделением поджелудочной железы, мол приезжайте срочно. ИИ, который прогнал его КТ-снимок, нашёл опухоль. Оказалось – рак, но на ранней стадии. Вырезали и мужчина выжил. Без этой технологии его бы нашли слишком поздно, когда 5-летняя выживаемость около 10%.
OpenAI к 2028 году увеличит мощности дата-центров в 90 раз
Epoch AI сделал публично доступным трекер крупнейших дата-центров. А человек из твиттера с ником Peter Gostev визуализировал суммарные мощности по месяцам в разрезе компаний, и цифры просто убийственные.
Робот с лазером собрал 20 млн долларов, чтобы выжигать сорняки ярче солнца
Carbon Robotics привлекла 20 миллионов долларов на разработку третьей линейки продуктов. Компания делает роботов, которые выжигают сорняки лазером и работают в 14 странах. А за всем этим стоит большая растительная модель, которую разрабатывали с первых дней.