打造台灣大腦!數發部徵民間語料,自主AI免受制於人

30 秒看重點

  • 事件:數發部啟動民間資料徵集,擴充「主權AI」訓練語料庫。
  • 意義:擺脫國外LLM對繁體中文及台灣文化理解不足的困境。
  • 影響:台灣企業與開發者將有更接地氣的台語與繁中AI工具。

這不只是收集資料,更是台灣在AI時代的「文化科技自衛擊」。透過建立屬於我們自己的高品質台語與繁中語料庫,我們才能確保未來的AI機器人說的是「台灣話」,而非被外國價值觀定義的文字。

關鍵數據:研調指出今年全球AI支出估增49.5%,主權AI基礎建設已是各國必爭之地。

為什麼台灣非得擁有自己的「主權AI」不可?

現在我們常用的 ChatGPT 或 Claude 雖然中文流利,但本質上是用西方或簡體中文語料庫訓練出來的。這就像請一位外國漢學家來當台灣中小企業的客服,他可能懂四書五經,但絕對不懂「巴比Q了」或「打拋豬放番茄」這種在地梗,甚至可能在敏感議題上給出非台灣主流價值的回答。數發部這次發動「民間資料徵集」,就是要將台灣在地的生活對話、台語、客語、甚至地方文史資料打包,餵給我們自己的大語言模型(如 TAIDE)。這就像是為台灣的 AI 打造一個專屬的「台灣大腦」,讓未來的 AI 應用不再水土不服,真正落實技術自主。

  1. 2023-04 國科會推出台灣自主研發的「TAIDE」繁體中文大語言模型。
  2. 2024-05 數發部與民間社群合作,著手規劃台語及在地文化語料庫。
  3. 近期 數發部正式啟動民間資料徵集,號召全民擴充台灣主權AI語料。

台灣怎麼看這件事?

對台灣的科技業與軟體開發者來說,這是一場及時雨。長期以來,台灣新創在開發在地化 AI 服務時,常面臨「買不起國外 API」或「國外模型不夠懂台語」的雙重困境。一旦數發部的主權AI語料庫建立完成並開源,台灣的中小企業就能用極低的成本,訓練出最懂台灣客群的 AI 智能客服、法律助理或台語語音導覽,大大提升台灣軟體產業的國際競爭力,擺脫硬體強、軟體弱的刻板印象。

編輯觀點

發展「主權 AI」不是口號,而是攸關國家安全的數位基礎建設。台灣擁有頂尖的半導體硬體,但如果軟體大腦(模型與語料)都裝別人的,無異於在沙灘上蓋城堡。數發部此舉方向正確,但後續的「資料著作權」篩選與「資料清洗」速度,將決定這個主權AI能不能在瞬息萬變的模型競爭中,真正發揮商用價值。

常見問題

什麼是主權AI?
指由國家自主掌控、訓練,並符合該國文化、法規與價值觀的AI系統,避免科技主權受制於國外企業。
為什麼國外的ChatGPT不夠台灣人用?
國外模型多以英文或簡體中文訓練,容易出現用詞不道地(如使用「視頻」、「質量」)或不懂台灣特有文化的問題。
這次數發部徵集的民間資料包含什麼?
主要徵集具台灣在地特色、無版權爭議的繁體中文、台語、客語等文本、語音及在地文史資料。
我提供資料會有版權問題嗎?
數發部會有一套嚴格的授權與篩選機制,確保徵集來的語料符合著作權法,並保護個人隱私。
這對一般台灣民眾有什麼好處?
未來我們使用的公部門服務、在地AI客服或教育軟體,會更懂台灣人的說話習慣與在地台語,溝通更順暢。

名詞小教室

大語言模型 (LLM)
就像一個讀過全世界圖書館書籍的超級「文字接龍高手」,能根據你給的題目,猜出下一個最合理的字詞。
主權AI (Sovereign AI)
這就像是國家自己蓋的「圖書館兼智庫」,裡面藏書和研究員都聽命於本國,確保國家文化與機密不外流。