Угрозы и $1 трлн не улучшают работу нейросетей

Post Thumbnail

Вы наверняка видели эти «секретные трюки» для управления нейросетями. Такие как угрозы, обещания наград, эмоциональные манипуляции. Но работают ли они на самом деле? Исследователи из Пенсильванского университета и Уортонской школы бизнеса провели масштабный эксперимент с 5 передовыми моделями: Gemini 1.5 Flash, Gemini 2.0 Flash, GPT-4o, GPT-4o-mini и GPT o4-mini.

Каждой модели задавали вопросы PhD-уровня по естественным наукам и сложные инженерные задачи. Для исключения случайных колебаний каждый запрос повторялся 25 раз.

Результаты оказались интересными! Ни 1 из 9 манипулятивных техник не показала статистически значимого улучшения точности ответов. Ни угрозы «пнуть щенка», ни обещания $1 трлн, ни душещипательные истории о больной маме не помогли моделям давать более качественные ответы!

Более того, эти «трюки» сделали результаты менее стабильными. В некоторых случаях точность возрастала на 36 процентных пунктов, а в других падала на 35! Зафиксированы даже случаи, когда модель полностью игнорировала основной вопрос, «залипая» на манипулятивной части промпта.

Вместо сомнительных уловок исследователи рекомендуют по-настоящему эффективную стратегию. Чёткая формулировка задачи, конкретизация желаемого формата ответа и предоставление релевантного контекста.

Почитать из последнего
В Siri обнаружили поддержку сторонних языковых моделей
Apple оставила в iOS 27 и macOS Golden Gate механизмы, которые позволяют подключать к Siri сторонние большие языковые модели. Датамайнер pdfu проверил их на практике и смог связать ассистента с Claude от Anthropic, а серверную модель Siri заменить на GPT-5.6 Terra от OpenAI.
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.