Музыку российских звёзд нашли в открытых датасетах

Post Thumbnail

ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.

Национальная федерация музыкальной индустрии изучила данные проекта AI Watchdog, который запустил журнал The Atlantic. Исследователи проверили две базы: Laion-Disco-12M от Laion с 12,3 млн треков и Sleeping-D 9M от Sleeping AI с 9,7 млн композиций — обе собраны с YouTube.

Результаты оказались довольно конкретными. В Laion-Disco-12M обнаружились 193 песни Басты, 150 треков Feduk, 144 песни Сергея Лазарева и 140 композиций Димы Билана. В той же базе нашли 135 песен группы «Звери», 119 Леонида Агутина, 99 Егора Крида и 50 Вани Дмитриенко.

Во второй коллекции картина сохранилась: 118 песен Лазарева, 119 Билана, 104 Басты, 91 Feduk, 80 Крида, 41 трек «Зверей», 38 Агутина и 24 Дмитриенко. Кроме того, там обнаружили 17 клипов Лазарева и 28 Крида.

И тут возникает главный вопрос: откуда всё это взялось? Представители «Первого музыкального издательства» и «ON лейбла» заявили, что запросов на лицензирование музыки от разработчиков нейросетей не получали. Они предположили, что композиции могли попасть в датасеты из пиратских источников.

История укладывается в более широкий конфликт вокруг происхождения обучающих данных. Ранее OpenAI обвиняли в скачивании книг из пиратской библиотеки Library Genesis, а Sony Music Publishing, Warner Chappell и другие издатели подали иск против Anthropic, Дарио Амодеи и Бенджамина Манна.

Для рынка это означает, что вопрос происхождения данных для ИИ становится не менее важным, чем сами модели. Если правообладатели добьются более прозрачных правил, бизнес получит понятнее условия работы с контентом, а создатели — больше возможностей контролировать его использование.

Телеграм про право в IT и AI. IT юристы — PravoWeb.com

Почитать из последнего
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.
OpenAI и Anthropic захотели притормозить ИИ, но не сошлись в деталях
Крупнейшие игроки рынка ИИ заговорили о паузе, однако внутри компаний тут же всплыл неудобный вопрос: кого пускать к секретам разработчиков?
Рейтинг IT-юристов 2026: как выбрать юрфирму для технологического бизнеса
Услуги «IT-юриста» в России в 2026 году оказывают компании четырёх разных типов, и ключевые различия между ними — не в базовом наборе задач (аккредитация, договоры, права на код есть почти у всех), а в четырёх параметрах: глубина именно AI-экспертизы, наличие международного контура, прозрачность цен и модель работы — от разовых документов до сопровождения под ключ.