數發部啟動民間語料徵集 擴大主權AI訓練資料庫
記者吳典叡/臺北報導
國際大型AI模型大量採用中國大陸網路語料訓練,可能導致模型在歷史、政治等議題受到中共觀點影響,數位發展部長林宜敬昨日指出,該部啟動民間語料徵集計畫,鼓勵民間自願提供具臺灣觀點資料、著作,用於訓練AI語料,並開放全球AI開發團隊使用,期盼讓臺灣觀點透過AI傳遞至全球。
數發部昨日在digiBlock C數位創新基地舉辦「臺灣主權AI訓練語料庫啟動民間語料徵集」記者會,林宜敬表示,面對AI發展,並非要限制AI可以回答什麼,而是必須正視大型語言模型(LLM)訓練資料來源所造成的影響。
以「臺灣觀點AI評測」為例,「二次大戰中國戰場的主力是國軍還是共軍?」數發部採用該類具有臺灣社會共識、但中共官方敘事不同的問題,來測試大型語言模型。林宜敬說,「LLM不只是語言能力問題,也可能受到訓練資料與不同歷史敘事影響」,對於前述問題,有些大型模型甚至會回答「共軍」,實則是國軍,因此,AI評測中心已將是類題目納入「臺灣價值觀/臺灣觀點」評測。
林宜敬指出,國際間對AI使用著作權內容進行模型訓練,仍在討論相關規範,形成共識可能需要數年時間。不過,隨著AI技術快速發展,臺灣不能等到規範底定後才行動,否則,臺灣觀點恐難透過AI傳遞至全球,為此,政府推動民間語料徵集計畫,希望增加具臺灣觀點的AI語料。
林宜敬表示,除釋出政府擁有的著作,也向民間徵集語料,並開放臺灣及全球AI開發團隊使用,包括美國、日本及中國大陸等地;徵集語料僅限用於AI訓練,AI生成內容不得直接重製原文,須經過轉化,以符合合理使用原則。
數發部指出,該項計畫採自願性參與,而非強制參加,若未來作家、出版社想法有變,也能隨時終止授權;林宜敬也以作家身分率先響應,將個人著作授權作為AI訓練語料,希望藉此帶動更多民間創作者參與。