Учёные сравнили 9000 человек с ИИ и выяснили, что люди креативнее

Post Thumbnail

В журнале Nature Human Behaviour опубликовали масштабное исследование креативности людей и больших языковых моделей. Учёные из Гонконгского университета и Северо-Западного университета сравнили 9198 человек с восемью LLM на тесте дивергентного мышления. В общей сложности 215 542 прогона моделей.

Результаты получились неоднозначные. GPT-4 Turbo набрал 81 балл и обошёл средний человеческий результат в 78–80 баллов. Claude 3.5 Sonnet показал 80 баллов.

Но когда исследователи сравнили верхние 10% людей с лучшими 10% ответов GPT-4 Turbo, люди победили со статистической значимостью p < 0.001. То есть средние нейросети обыгрывают, но лучших — нет.

Для оценки использовался Divergent Association Task. Это тест, где нужно назвать 10 существительных, максимально непохожих друг на друга. Креативность измеряется алгоритмически через семантическую дистанцию между словами, без субъективных оценок жюри.

Главное различие оказалось не в средних баллах, а в распределении. Дисперсия у людей значимо выше. Есть и слабые, и выдающиеся результаты. Тогда как модели выдают стабильную середину. При этом люди генерируют значимо больше уникальных слов: модели между сессиями повторяют одни и те же ответы.

Авторы вводят термин креативная мимикрия для описания того, как LLM симулируют оригинальность. Модели используют две стратегии: вытаскивают редкие слова из корпуса или полагаются на параметр температуры для внесения случайности. Но это не понимание смысла, а статистическая манипуляция.

Почитать из последнего
OpenAI готовит армию говорящих устройств и новую голосовую модель
Издание The Information выяснило забавную вещь про OpenAI. Оказывается, когда вы общаетесь с ChatGPT голосом, вы разговариваете совсем не с той моделью, которая отвечает текстом. Голосовая версия 4o не получила ни одного обновления после выхода GPT-5. Она не умеет думать, не знает про цепочки рассуждений. Ничего из того, чем хвастались в последних релизах. Просто старая добрая болтушка, застывшая в прошлом году.
Samsung хотят обойти Apple по ИИ-функциям и вернуть лидерство
В прошлом году Samsung поставила на рынок 400 миллионов мобильных устройств с ассистентом Google Gemini. Этого, видимо, показалось мало. В этом году южнокорейский гигант намерен удвоить количество до 800 миллионов штук. Тэ Мун Ро, один из двух гендиректоров Samsung Electronics, объяснил агентству Reuters это просто. Компания стремится распространить функции ИИ на все устройства и все услуги как можно скорее.
Alibaba научила алгоритм видеть рак там, где врачи пропускают
Каменщик 57 лет в Китае пришёл в больницу проверить диабет. Обычный осмотр, ничего особенного. Через 3 дня ему звонит заведующий отделением поджелудочной железы, мол приезжайте срочно. ИИ, который прогнал его КТ-снимок, нашёл опухоль. Оказалось – рак, но на ранней стадии. Вырезали и мужчина выжил. Без этой технологии его бы нашли слишком поздно, когда 5-летняя выживаемость около 10%.
OpenAI к 2028 году увеличит мощности дата-центров в 90 раз
Epoch AI сделал публично доступным трекер крупнейших дата-центров. А человек из твиттера с ником Peter Gostev визуализировал суммарные мощности по месяцам в разрезе компаний, и цифры просто убийственные.
Робот с лазером собрал 20 млн долларов, чтобы выжигать сорняки ярче солнца
Carbon Robotics привлекла 20 миллионов долларов на разработку третьей линейки продуктов. Компания делает роботов, которые выжигают сорняки лазером и работают в 14 странах. А за всем этим стоит большая растительная модель, которую разрабатывали с первых дней.