Необычное сотрудничество конкурентов в тестировании безопасности ИИ

Post Thumbnail

2 главных конкурента в мире искусственного интеллекта впервые объединились для совместного тестирования безопасности. OpenAI и Anthropic открыли друг другу доступ к своим секретным моделям. В индустрии, где компании платят исследователям по $100 млн и борются за каждого пользователя, такое сотрудничество выглядит невероятным.

Сооснователь OpenAI Войцех Заремба объяснил важность момента. Миллионы людей используют искусственный интеллект каждый день. Технологии стали настолько влиятельными, что безопасность важнее корпоративной конкуренции. Компании должны установить общие стандарты, несмотря на миллиардные инвестиции и войну за таланты.

Для исследования компании предоставили друг другу специальный доступ к моделям с ослабленными защитными механизмами. Это позволило найти слепые зоны в системах безопасности каждой компании. GPT-5 не участвовала в тестировании, потому что ещё не была выпущена.

Самое интересное открытие касается галлюцинаций. Claude Opus 4 и Sonnet 4 отказываются отвечать на 70% вопросов, когда не уверены в ответе. Модели честно говорят пользователю, что у них нет надёжной информации. Модели OpenAI o3 и o4-mini ведут себя иначе. Они почти всегда пытаются дать ответ, даже когда не знают правильного. Результат предсказуемый. Высокий уровень галлюцинаций и ложной информации.

Сооснователь OpenAI Войцех Заремба признаёт проблему. Модели OpenAI слишком самоуверенны, а модели Anthropic слишком осторожны. Правильный баланс где-то посередине. Пользователям нужны и полезные ответы, и честность о границах знаний модели.

История получила драматичное продолжение. После завершения исследования Anthropic отозвала доступ у другой команды OpenAI. Причина в нарушении условий использования. Запрещено использовать Claude для улучшения конкурирующих продуктов. Заремба утверждает, что эти события не связаны с совместным исследованием безопасности.

Николас Карлини из Anthropic смотрит в будущее с оптимизмом. Он хочет продолжать предоставлять исследователям безопасности OpenAI доступ к моделям Claude. Цель амбициозная. Сделать такое сотрудничество регулярным явлением в индустрии.

Почитать из последнего
В Siri обнаружили поддержку сторонних языковых моделей
Apple оставила в iOS 27 и macOS Golden Gate механизмы, которые позволяют подключать к Siri сторонние большие языковые модели. Датамайнер pdfu проверил их на практике и смог связать ассистента с Claude от Anthropic, а серверную модель Siri заменить на GPT-5.6 Terra от OpenAI.
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.