AI 真的聽得懂台灣人嗎?從主權語料庫看見下回合資料戰
數位發展部去年底正式上線「臺灣主權 AI 訓練語料庫」,首波就集結超過 200 個政府機關、逾 2,000 筆資料集與超過 6 億 tokens,之後又在一個多月內擴增到超過 11 億 tokens,顯示台灣正讓 AI 更懂本地語言這件事,變成基礎建設。同時,台美最新數位合作也把 AI 管理、可信賴 AI 與正體中文語料庫列為合作重點,這代表下回合 AI 競爭是誰能先掌握語料、語境與在地知識。
AI會回答,不代表AI聽得懂台灣
我們或許都有這種經驗,把問題交給大型語言模型,它能迅速產生流暢答案,卻可能把台灣的地名、制度、歷史與生活語境理解錯誤。它知道「九份」是個景點,卻未必理解山城、礦業遺產與觀光壓力的關係;即使能完成台語或客語的表面翻譯,也不一定掌握腔調、語氣和使用情境。
語言不只是詞彙排列,也是社會經驗的累積。數位發展部去年12月上線「臺灣主權AI訓練語料庫」,首波集結超過200個政府機關、逾2,000筆資料集與超過6億tokens,內容涵蓋語言、文化、教育、生物與地理環境等領域,要的不只將簡體中文轉成繁體中文的模型,要能理解台灣制度、歷史記憶與日常說法的AI。
主權語料庫補的是什麼洞
過去台灣談AI,焦點多放在晶片、伺服器與算力,但模型即使擁有強大硬體,若訓練資料缺少台灣內容,輸出的「本土化」仍可能只是表面。主權語料庫的價值,正在於把政府長期累積、卻分散在不同機關的資料,整理成可供模型訓練與應用的資源。
語料庫規模也持續擴大。數發部今年2月公布已上架逾3,000筆資料集、超過11億tokens;4月增至逾12億tokens,並與中央研究院合作新增超過620萬tokens的研究與科普文本。7月再納入約2,000萬客語tokens,官方表示累積語料量已超過15億tokens。筆者認為除了資料「變多」,AI也開始接觸台灣多語社會的真實結構。不過,資料量不能取代品質,授權、代表性、更新頻率與偏誤檢查,才決定語料庫是公共基礎建設,還是另一個資料倉庫。
資料就是AI戰場
下場AI競爭,在於能有最大的模型以外,還能掌握足夠合法、可信且有文化脈絡的資料,美台第六屆「經濟繁榮夥伴對話」已把AI管理、可信賴AI與正體中文語料庫列為合作方向,雙方也討論推動可信正體中文語料在大型語言模型的發展與應用。這項合作有戰略意義,台灣是全球AI硬體供應鏈的重要節點,也有機會可信資料與語言管理建立軟實力。對我們而言,台灣不應只把語料庫當成服務國內模型公司的工具,更應把它發展成國際可信AI標準的一部分,讓其他民主社會也能使用透明、可追溯並尊重著作權的正體中文資料。
台灣真正要搶的是話語權
主權AI的核心,從來不是把所有資料鎖在國家手中,而是能決定保存哪些知識、如何解釋,以及誰能公平使用,這意味著語料庫不能只有政府公文,還需要地方記憶、原住民族語言、客語、台語、產業經驗與民間創作,並建立清楚的授權和回饋機制。
台灣真正要搶的不是「做出台灣版ChatGPT」口號,而是在全球模型競爭下保有自己的語境與發言位置。當AI逐漸成為人們取得知識、學習歷史和理解公共議題的入口,誰能提供可信的語料,誰就不只是在訓練模型,也是定義未來世界如何理解台灣。
(首圖來源:AI)