數發部啟動民間語料徵集 擴大台灣AI訓練資料庫
數發部長林宜敬指出,國際大型AI模型大量採用中國網路語料訓練,可能導致模型在歷史、政治等議題受到中國觀點影響。因此,數發部啟動民間語料徵集計畫,鼓勵民間自願提供具台灣觀點資料、著作,用於訓練AI語料,並開放全球AI開發團隊使用,期盼讓台灣觀點透過AI傳遞至全球。
數發部15日舉辦「啟動民間語料徵集記者會」,林宜敬指出,國際大型AI模型大量採用中國網路語料進行訓練,但在歷史、政治價值上受到中國觀點影響。
林宜敬說,國際間對AI使用著作權內容進行模型訓練,仍在討論相關規範,形成共識可能需要數年時間。不過,隨著AI技術快速發展,台灣不能等到規範底定後才行動,否則台灣觀點恐難透過AI傳遞至全球。為此,政府推動民間語料徵集計畫,希望增加具台灣觀點的AI語料。
他說,除釋出政府擁有的著作,也向民間徵集語料,並開放台灣及全球AI開發團隊使用,包括美國、日本及中國等地;徵集語料僅限用於AI訓練,AI生成內容不得直接重製原文,須經過轉化(transformation),以符合合理使用原則。
林宜敬說,許多民眾透過AI語言模型搜尋資料,若作者開放作品供AI訓練,可讓模型了解作品內容及作者觀點,他說:『(原音)語料徵集是自願性的,作者把他的語料開放出來,好處就是可以讓人更清楚了解他的作品。我們知道現在很多人他要上網找資料,常常都是直接問AI語言模型,那譬如說我的作品如果我沒有開放出來給這些AI模型去訓練的話,這些AI模型就不會知道我的作品,然後我的觀點就不能影響到這個世界。』
數發部指出,本項計畫採自願性參與,而非強制參加,若未來作家、出版社想法有變,也能隨時終止授權;林宜敬也以作家身分率先響應,將個人著作授權作為AI訓練語料,希望藉此帶動更多民間創作者參與。(編輯:宋皖媛)