30 秒看重點
- 事件: 數發部大規模徵集民間語料,擴增台灣AI訓練資料庫,加速主權AI發展。
- 意義: 建立在地化、具文化脈絡的「台灣主權AI」,不再受制於國外大型模型。
- 影響: 強化台灣AI技術自主性,加速產業應用,保障台灣數位內容與資安。
台灣數位發展部正式向民間徵集文本、語音等多元資料,目標將台灣專屬的AI語料庫規模推升逾三倍。這不只是單純的資料蒐集,更是為打造具備「台灣靈魂」的AI模型打下基石,確保台灣在AI浪潮中掌握自主權與話語權。
台灣AI為何需要自己的語料庫?
在全球AI競爭白熱化、各國積極投入資源的背景下,台灣數位發展部(數發部)啟動大規模民間語料徵集,是為台灣AI發展注入在地DNA的關鍵一步。目前,主流的大型語言模型(LLM)多以英文或簡體中文為主要訓練語料,這使得它們在處理繁體中文、台灣特有文化、流行語、專業術語或法規時,往往會出現「水土不服」的狀況,就像一個看外文書長大的外國小孩,雖然能說中文,但對台灣風土人情卻可能一知半解。
數發部這項計畫,正是要補足這個空缺。繼去年公布首批「台灣通用語言模型」後,現在更積極向民間徵集涵蓋文字、圖片、影音甚至3D模型等多元、豐富的「數位教材」。這個龐大的「台灣主權AI語料庫」就像是專門為台灣AI量身打造的「成長養分」,讓AI模型能夠學習並理解最道地的台灣話,辨識台灣地標、理解台灣法律與醫療專有名詞、掌握台灣的社會脈絡與文化語境。這對於發展具備台灣口音的語音助理、本土化AI客服、客製化翻譯工具,乃至於提升政府服務效率的智慧應用,都至關重要。透過這樣的方式,我們不僅能確保台灣AI技術的自主性與資訊安全,避免敏感資料或特定觀點被外國模型誤讀或操控,更能提升台灣AI產業在全球供應鏈中的獨特性和競爭力,讓台灣不只在硬體上是護國神山,在AI軟體「頭腦」也能展現強大實力。
- 2023-10: 數發部正式公布首批「台灣通用語言模型」與國家級AI語料庫,邁出台灣AI自主發展的第一步。
- 近期: 數發部啟動大規模民間語料徵集計畫,目標將現有語料庫規模擴增逾三倍,並廣納更多元資料。
台灣怎麼看這件事?
這項由數發部主導的語料徵集計畫,對台灣的AI生態系而言,無疑是一劑強心針。 它不僅為台灣本地的AI新創公司、研究機構、學術單位提供了不可多得的珍貴訓練資源,大幅降低了他們開發本土化AI模型的成本與門檻,加速了台灣AI產品的創新與開發。更重要的是,它能讓台灣特有的數位內容、在地知識與文化脈絡,得以在AI時代獲得保存與發揚。未來,我們將能看到更多「更懂台灣人」的AI應用,例如能聽懂台灣腔、理解台灣流行語的智慧助理,提供更符合台灣市場需求和文化習慣的客製化服務,或是醫療院所能有更精準的醫療問診AI,公部門也能打造更貼近民意的智慧化服務。這不僅是台灣AI從「被動使用者」轉變為「主動建構者」的關鍵一步,更強化了台灣在AI供應鏈中的策略性地位,讓台灣在全球AI浪潮中,不只供應硬體,也能輸出具備台灣價值的AI「軟實力」。
編輯觀點
數發部積極佈局台灣主權AI語料,這步棋走得正是時候,也極具戰略眼光! 在全球AI軍備競賽白熱化、大國角力日益激烈的背景下,掌握自己的AI核心「燃料」——也就是語料,就等於掌握了未來發展的自主權與話語權。這不僅是單純的技術問題,更是關乎國家文化主權與資訊安全的重要議題。我們應樂見政府與民間協力合作,加速累積這筆珍貴的數位資產,讓台灣AI不只在硬體製造上是全球中堅,在軟體「頭腦」也能展現台灣特有的智慧與價值,打造真正的「護國神山」級AI實力。
常見問題
- 什麼是「主權AI」?
- 主權AI指的是一個國家或地區擁有自主開發、控制及運用的人工智慧系統,其訓練資料、模型演算法皆掌握在自己手中,不依賴外國技術,以保障國家資訊安全與戰略自主。
- 為什麼台灣AI需要自己的語料庫?
- 台灣的語言、文化、法律、社會脈絡都非常獨特。若只用國外語料訓練的AI,可能無法精準理解台灣在地情境,導致誤判或錯誤回應。自有語料庫能確保AI更「懂」台灣,提供貼近台灣的服務。
- 民間資料徵集會不會有資安或隱私問題?
- 數發部強調會遵循《個人資料保護法》及相關法規,對徵集到的語料進行嚴格的去識別化處理,並建立資安防護機制,確保資料僅用於AI模型訓練,不會外洩或用於其他商業用途。
- 這些語料庫對一般民眾有什麼好處?
- 未來台灣的AI應用會更貼近生活,例如能聽懂台灣腔、理解台灣流行語的智慧助理,或提供更符合台灣市場的客製化服務,讓AI產品與服務更在地化、更實用,提升整體生活品質。
- 除了語料庫,台灣發展AI還有哪些挑戰?
- 除了語料,台灣在AI人才培育、算力基礎設施、軟體開發生態系以及相關法規調適等方面都仍有進步空間。需要政府與業界持續投入資源,建構更完整的AI產業鏈與支持環境。
名詞小教室
- AI語料庫 (AI Corpus)
- 想像AI要學習語言,語料庫就是它要讀的「教科書」。這些教科書包含了大量的文字、語音、圖片等資料,讓AI從中學習語言規則、文化脈絡、知識邏輯,是訓練AI模型不可或缺的「數位食糧」。
- 大型語言模型 (Large Language Model, LLM)
- 就像一個超級聰明、學富五車的學生。它透過閱讀海量文本學會了理解、生成人類語言,能寫文章、翻譯、回答問題,是目前許多AI應用背後的核心技術。