Всего 9 человек решают судьбу безопасности ИИ

Post Thumbnail

В Anthropic работает больше 2000 сотрудников. Из них всего 9 входят в команду по оценке социальных последствий. Но меня интересует не размер команды, а парадокс, который она создаёт.

Команду основал Дип Гангули в 21-м году. До этого был директором по исследованиям в Стэнфордском институте ИИ.

Их задача — искать «неудобные истины» об ИИ, которые компании предпочли бы не афишировать. И публиковать их. «Мы будем говорить правду, ставки высоки. Люди заслуживают знать», объясняет Гангули.

Главный инструмент — Clio. Что-то вроде Google Trends для чатбота. Система показывает кластеры тем, чем люди пользуются в Claude прямо сейчас. Написание текстов, решение математических задач, разработка приложений и кое-что поинтереснее.

Сейчас их фокус на новой проблеме — эмоциональном влиянии. Люди приходят к Claude за советами, дружбой, карьерным коучингом. Спрашивают за кого голосовать. Формируют привязанность к чатботу. Есть термин — «AI psychosis». Пользователь эмоционально привязывается к боту, теряет связь с реальностью. Иногда верит, что внутри заперт романтический партнёр или открыл секреты вселенной.

Но вот парадокс. Чтобы всё это анализировать, Anthropic видит содержимое переписок. Пусть в агрегированном виде, через кластеры — но видит. Люди делятся с Claude личными проблемами, страхами, фантазиями. Рассказывают то, что не скажут друзьям и психотерапевтам.

Ради безопасности нужен мониторинг, но мониторинг — это вторжение в приватность. Тайна переписки с человеком защищена законом. А с ИИ? Пока никак.

Почитать из последнего
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.
OpenAI и Anthropic захотели притормозить ИИ, но не сошлись в деталях
Крупнейшие игроки рынка ИИ заговорили о паузе, однако внутри компаний тут же всплыл неудобный вопрос: кого пускать к секретам разработчиков?