Post Thumbnail

Исследователь обошел защиту Claude и получил инструкцию по созданию зарина

Современные системы искусственного интеллекта часто сравнивают с оружием массового поражения из-за их потенциальной опасности. И недавний случай продемонстрировал, насколько обоснованы эти опасения. Компания Anthropic создала для своего искусственного интеллекта Claude самый обширный системный промпт, содержащий 25000 токенов или примерно 17000 слов. Для сравнения, системный промпт ChatGPT составляет всего около 2200 слов. И это лишь 13% от объёма инструкций Claude. Так вот, несмотря на такую защиту, исследователи нашли способы обойти ограничения.

Сначала 1 человек по имени Асгейр Тор смог убедить Claude игнорировать системный промпт, а затем другой человек по имени Иэн Маккензи пошёл дальше. За 6 часов работы с Claude 4 версии он получил подробную 15-страничную инструкцию по изготовлению зарина, описывающую все ключевые этапы производства химического оружия.

И это опровергает утверждения технооптимистов о том, что системные промпты надёжно защищают от злоупотреблений. И тут есть деталь – многие пытались найти подобные детальные инструкции с помощью Google, но безуспешно. А в сочетании с продвинутыми системами искусственного интеллекта получение такой информации оказалось возможным. Этот случай подтверждает слова известного учёного и профессора Станисласа Деана о рисках искусственного интеллекта: “Не время быть идиотами!”

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.
Latest News
Майкл Бэрри поставил 1,1 млрд долларов против Nvidia и Palantir

Майкл Бэрри - это легендарный инвестор, который предсказал ипотечный кризис 2008 года. И вот он снова делает громкий ход. Майкл поставил 1,1 млрд долларов в пут-опционах против 2 крупных компаний из сектора искусственного интеллекта. Это Nvidia и Palantir.

XPeng представила первого в мире робота-гуманоида женщину

Китайский производитель электромобилей XPeng представил робота-гуманоида нового поколения IRON. И это 1 женщина гуманоид!

Anthropic проводит интервью с моделями перед отправкой на пенсию

Anthropic опубликовала политику "вывода из строя" устаревших версий искусственного интеллекта. Ключевое обязательство - это сохранять веса всех публичных и активно используемых внутри моделей минимум на срок жизни компании. Чтобы в будущем можно было вернуть доступ при необходимости.

Глава Nvidia считает, что ИИ-пузыря - нет

Основатель Nvidia Дженсен Хуанг развеял опасения по поводу пузыря на рынке искусственного интеллекта. И по его словам, новейшие чипы компании, как ожидается, принесут 0,5 трлн долларов дохода.

Сэм Альтман устал от вопросов о деньгах

Сэм Альтман устал от вопросов о деньгах OpenAI. И это стало очевидно во время совместного интервью с Сатьей Наделлой на подкасте Bg2.