首頁 地方 台北

數發部擴充主權AI語料庫 新增2000萬客語tokens

【記者戴德蔓/台北報導】為厚植台灣在地文化與語言的AI實力,數位發展部近日攜手客家委員會,將客家語言資源、出版品、文史典藏及研究報告等內容納入「台灣主權AI訓練語料庫」,新增約2000萬tokens高品質客語語料。數發部表示,此舉將有助提升AI對客語及客家文化的理解能力,支援客語智慧客服、教育學習、本土文化知識服務及公共政策等多元AI應用。

數發部持續推動「台灣主權AI訓練語料庫」,廣納高品質、具在地化的正體中文語料。語料庫於去年底正式上線後,AI模型開發團隊、學研機構及相關單位可至語料庫申請使用及取得資料集,拓展更多AI應用可能。

數發部7月24日表示,客語作為我國國家語言之一,承載著深厚的歷史與文化底蘊。此次與客委會合作,為台灣主權AI語料注入更多元的文化與語言內容。

數發部指出,本次客委會提供的語料內容極具指標性,涵蓋詩集創作、客家風情及客語教學圖書等政府出版品,以及客語能力認證各級詞彙教材與題庫、口語採錄文本、文化典藏,還有客語復振、政策發展與文化治理等學術與政策研究資料。

數發部表示,此次納入的語料內容,不僅展現臺灣客家文化保存的豐碩成果,也有助提升AI模型對客語不同腔調、語意及文化脈絡的理解與生成能力,未來可廣泛應用於客語智慧客服、本土文化知識服務及公共政策等AI創新應用。

數發部指出,目前這批客語語料已正式上架,AI模型開發團隊、學研機構及相關單位可至「台灣主權AI訓練語料庫」官網申請使用,也歡迎各界將研究成果、應用案例及更多具臺灣特色的優質語料回饋至語料庫,讓更多創新想法持續發芽,共同壯大臺灣主權AI。

數發部表示,「台灣主權AI訓練語料庫」自上線以來,已累積逾15億tokens語料量,未來將持續攜手政府機關釋出優質語料,深化公私協力,推動民間語料徵集,逐步建構具臺灣代表性與專業知識的資料基礎。