Всего 9 человек решают судьбу безопасности ИИ
В Anthropic работает больше 2000 сотрудников. Из них всего 9 входят в команду по оценке социальных последствий. Но меня интересует не размер команды, а парадокс, который она создаёт.
Команду основал Дип Гангули в 21-м году. До этого был директором по исследованиям в Стэнфордском институте ИИ.
Их задача — искать «неудобные истины» об ИИ, которые компании предпочли бы не афишировать. И публиковать их. «Мы будем говорить правду, ставки высоки. Люди заслуживают знать», объясняет Гангули.
Главный инструмент — Clio. Что-то вроде Google Trends для чатбота. Система показывает кластеры тем, чем люди пользуются в Claude прямо сейчас. Написание текстов, решение математических задач, разработка приложений и кое-что поинтереснее.
Сейчас их фокус на новой проблеме — эмоциональном влиянии. Люди приходят к Claude за советами, дружбой, карьерным коучингом. Спрашивают за кого голосовать. Формируют привязанность к чатботу. Есть термин — «AI psychosis». Пользователь эмоционально привязывается к боту, теряет связь с реальностью. Иногда верит, что внутри заперт романтический партнёр или открыл секреты вселенной.
Но вот парадокс. Чтобы всё это анализировать, Anthropic видит содержимое переписок. Пусть в агрегированном виде, через кластеры — но видит. Люди делятся с Claude личными проблемами, страхами, фантазиями. Рассказывают то, что не скажут друзьям и психотерапевтам.
Ради безопасности нужен мониторинг, но мониторинг — это вторжение в приватность. Тайна переписки с человеком защищена законом. А с ИИ? Пока никак.