Эксперимент, в котором GPT-5 саботировал работу, а Gemini спорил

Post Thumbnail

Команда Ubuntu решила проверить, насколько ИИ готов к реальной работе с документацией. Для этого взяли 5 топовых моделей и дали им задачи, с которыми сталкивается каждый день. Всё честно — промпты и скрипты выложили в открытый доступ, можете повторить.

Первое испытание выглядело простым: адаптировать британский английский под американский вариант. Казалось бы, рутина для языковых моделей. Claude Sonnet вытянул на 7 баллов из 10, что вполне прилично. А вот GPT-5 просто молча отказался работать. 0 баллов, никаких объяснений. Но настоящий цирк устроил Gemini: сначала тормозил, потом начал менять слова в обратную сторону. Когда ему на это указали, модель согласилась с ошибкой, потом устроила внутренний диалог сама с собой. И гордо заявила, что претензии необоснованны. ИИ научился спорить с пользователями — прогресс!

Зато на других задачах системы реабилитировались. Claude сгенерировал метаописания для 250 страниц, сэкономив команде 2 недели жизни. Оптимизация проверки ссылок ускорилась на 85 процентов — с 10 минут до 1.5. Скрипт для автообновления редиректов заработал с первого раза.

Но главное открытие оказалось неприятным. Всё сэкономленное время уходит на проверку результатов. Ревью работы ИИ отнимает в 2–3 раза больше времени, чем проверка работы живых коллег. Модели выдают случайные странности, и чем лучше они работают в целом, тем опаснее пропустить косяк.

Почитать из последнего
Из-за ИИ клавиатуры исчезнут из офисов
Лондонская школа экономики совместно с Jabra выдала любопытный прогноз. К 28-му году голосовой ИИ станет стандартом в офисах. А поколение Альфа — рождённые после 2010 года — возможно, никогда не узнает, каково это писать email руками. Но пока мне не верится, что клавиатуры действительно исчезнут.
ChatGPT обогнал TikTok и Disney
ChatGPT заработал 3 миллиарда долларов на мобильных подписках. Цифра впечатляет, но ещё интереснее скорость, с которой её достигли.
Собаки-поводыри скоро станут робо-псами с ИИ
Инженеры из США и Южной Кореи превратили робо-пса Unitree Go2 в собаку-поводыря. Модель ИИ GuideNav использует одну обычную камеру вместо дорогих датчиков LiDAR. И это работает.
Американцы заваливают китайский ИИ деньгами
Американские инвесторы завалили китайских разработчиков ИИ деньгами. Несмотря на геополитическое противостояние. Получается, прибыль побеждает политику.
OpenAI и Anthropic внедряют распознавание детей
Компании OpenAI и Anthropic внедряют технологии распознавания несовершеннолетних пользователей чат-ботов. OpenAI обновила правила взаимодействия ChatGPT с пользователями от 13 до 17 лет. Anthropic работает над системой идентификации и блокировки пользователей младше 18.