Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Национальная федерация музыкальной индустрии изучила данные проекта AI Watchdog, который запустил журнал The Atlantic. Исследователи проверили две базы: Laion-Disco-12M от Laion с 12,3 млн треков и Sleeping-D 9M от Sleeping AI с 9,7 млн композиций — обе собраны с YouTube.
Результаты оказались довольно конкретными. В Laion-Disco-12M обнаружились 193 песни Басты, 150 треков Feduk, 144 песни Сергея Лазарева и 140 композиций Димы Билана. В той же базе нашли 135 песен группы «Звери», 119 Леонида Агутина, 99 Егора Крида и 50 Вани Дмитриенко.
Во второй коллекции картина сохранилась: 118 песен Лазарева, 119 Билана, 104 Басты, 91 Feduk, 80 Крида, 41 трек «Зверей», 38 Агутина и 24 Дмитриенко. Кроме того, там обнаружили 17 клипов Лазарева и 28 Крида.
И тут возникает главный вопрос: откуда всё это взялось? Представители «Первого музыкального издательства» и «ON лейбла» заявили, что запросов на лицензирование музыки от разработчиков нейросетей не получали. Они предположили, что композиции могли попасть в датасеты из пиратских источников.
История укладывается в более широкий конфликт вокруг происхождения обучающих данных. Ранее OpenAI обвиняли в скачивании книг из пиратской библиотеки Library Genesis, а Sony Music Publishing, Warner Chappell и другие издатели подали иск против Anthropic, Дарио Амодеи и Бенджамина Манна.
Для рынка это означает, что вопрос происхождения данных для ИИ становится не менее важным, чем сами модели. Если правообладатели добьются более прозрачных правил, бизнес получит понятнее условия работы с контентом, а создатели — больше возможностей контролировать его использование.
—
Телеграм про право в IT и AI. IT юристы — PravoWeb.com