AI 音樂訓練資料有得查:創作者終於可以睇自己有冇入庫
Tech News

AI 音樂訓練資料有得查:創作者終於可以睇自己有冇入庫

圖片:via The Verge — https://www.theverge.com/ai-artificial-intelligence/953183/the-atlantic-searchable-database-music-ai-training-data
TechLab 編輯部(譯)·

四個公開 dataset 揭出 AI 音樂工具背後授權灰位

件事重點

The Verge 報道,The Atlantic 記者 Alex Reisner 搵到四個喺 AI 開發圈流通嘅音樂 dataset,並喺 The Atlantic 嘅 AI Watchdog 頁面整成可搜尋 database。規模有幾誇?LAION-DISCO-12M 有 12,320,916 條 YouTube 音樂紀錄,Sleeping-DISCO-9M 有 9,713,413 條紀錄,另外 Spotify Tracks Dataset 有 114,000 首,Free Music Archive dataset 就有 106,574 首。呢啲數唔係普通歌單,係開發者可以攞嚟訓練、測試、微調模型嘅材料清單。

database 有咩用

以前創作者聽到 AI 音樂工具可能用咗海量歌曲,最多只可以鬧句「唔透明」。而家 The Atlantic 呢個 database 起碼畀你做三件事:查 artist 名、查歌名、睇中咗邊個 dataset。中咗名唔代表某個商用 AI 服務一定訓練過你首歌;查唔到亦唔代表安全,因為呢度只係四個 Reisner 搵到嘅 dataset。不過由完全黑箱去到有名有姓,已經係好大分別。

最大灰位:link 唔等於授權

最麻煩係,三個 dataset 主要派發 YouTube 或 Spotify link 同 metadata,唔係直接派 MP3。LAION 自己都寫明,LAION-DISCO-12M 只收 publicly available YouTube samples 嘅 link 同 metadata,亦話唔派原始 audio,建議用途偏研究,仲強烈叫人唔好喺商業場景或原樣做成 end products。呢個講法表面上係同原檔保持距離,不過創作者真正擔心嘅係:如果有人之後用工具自動拉 audio,避開登入、廣告同分潤機制,「只係 link」就未必夠交代。

Google 同 Stability 點解重要

The Atlantic 提到 Google 同 Stability AI 喺研究 paper 入面寫明用過 FMA 呢類資料。Google MusicLM paper 寫到,佢哋用 FMA 訓練 SoundStream 同 w2v-BERT,之後再用 500 萬段 audio clip、合共 28 萬小時音樂訓練其他部分;Stability 嘅 Stable Audio Open paper 同官方頁就寫明,用 472,618 段 Freesound 加 13,874 段 FMA,仲標榜 Creative Commons、審查同 attribution。呢度要分清楚:研究用過唔等於商用產品一定照搬同一包 data,但代表「公開 dataset」早就係主流 AI 音樂研究嘅燃料。

對創作者同用 AI 音樂嘅人有咩影響

如果你係音樂人,可以先查自己 artist 名同常用拼法,再記低係邊個 dataset、出現幾多次、source 係 YouTube、Spotify 定 FMA;呢啲唔係訴訟結論,但係之後搵平台、publisher、唱片公司或者律師傾,會實淨過淨係講「我覺得俾 AI 用咗」。如果你係 YouTuber、podcaster、廣告或短片創作者,風險就係另一邊:AI music tool 寫住 royalty-free,都唔代表訓練來源、output 授權同客戶商用要求全部冇問題。品牌 job 最好留低服務條款版本、生成日期、prompt、輸出檔同授權頁面截圖,唔好只靠一句「AI 生成」交差。

下一步睇咩

AI 音樂而家已經由玩具變成內容供應鏈一部分。AI 音樂數量愈來愈多,平台、工具商同用家都要交代來源同授權。The Atlantic 呢個 database 唔會一次過解決版權爭議,但佢起碼令討論可以返到逐首歌、逐個 dataset 嘅證據上;做音樂、做影片、做廣告嘅人,而家最少多咗一個地方可以先查清楚。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook