В зарубежных открытых датасетах, используемых для исследований и обучения ИИ, обнаружили сотни песен популярных российских исполнителей. Национальная федерация музыкальной индустрии выявила их в наборах Laion-Disco-12M и Sleeping-D 9M, которые содержат миллионы композиций с YouTube, сообщают «Ведомости».
Больше всего треков оказалось у Басты: 193 композиции в одном датасете и 104 в другом. В число лидеров также вошли Feduk, Сергей Лазарев, Дима Билан, группа «Звери», Леонид Агутин, Егор Крид и Ваня Дмитриенко. Кроме того, в этих датасетах оказались и видео с участием артистов — 17 роликов с Сергеем Лазаревым и 28 с Егором Кридом.
Однако эксперты отмечают, что само наличие песни в датасете не доказывает, что она использовалась для обучения конкретной генеративной модели.
Российские правообладатели заявляют, что не получали запросов на лицензирование этих произведений для обучения ИИ. В музыкальной индустрии предполагают, что разработчики могут использовать контент из открытых интернет-источников, включая пиратские ресурсы.
По оценке НИУ ВШЭ, совокупные потери авторов и других правообладателей от использования генеративного контента могут достигнуть 1 трлн руб. в 2025−2030 годах. При этом международная практика лицензирования уже формируется: крупные музыкальные компании заключают соглашения с разработчиками ИИ об использовании каталогов для обучения моделей.
Ранее «Яндекс Музыка» ввела маркировку ИИ-треков.
