首頁 地方 台北

台灣不能缺席AI大腦 數發部啟動民間語料徵集

數發部長林宜敬(左4)9月15日宣布啟動民間語料徵集,擴大納入出版及電子書內容;台灣主權AI訓練語料庫目前已累計逾22億詞元,盼打造具台灣特色的可信賴AI。(記者戴德蔓/攝影)
數發部長林宜敬(左4)9月15日宣布啟動民間語料徵集,擴大納入出版及電子書內容;台灣主權AI訓練語料庫目前已累計逾22億詞元,盼打造具台灣特色的可信賴AI。(記者戴德蔓/攝影)

【記者戴德蔓/台北報導】生成式AI快速改變人們取得資訊的方式,但AI「腦袋」裡有沒有台灣?數位發展部9月15日正式啟動台灣主權AI訓練語料庫民間語料徵集。數發部長林宜敬表示,若等待著作權爭議數年後才形成共識,台灣觀點恐已在AI世界缺席,「我們不能等」。

數發部15日舉行「台灣主權AI訓練語料庫啟動民間語料徵集」活動,將原本以政府資料為主的語料庫進一步擴大至民間,向出版社、電子書平台、媒體及創作者徵集高品質原創內容。林宜敬也以作家身分率先響應,將自己的著作授權作為AI訓練語料。

秀威資訊、印刻文學、Readmoo讀墨、食力、巨思文化等出版及電子書平台業者,以及作家藍弋丰等人也出席,簽署授權同意書。

林宜敬表示,台灣是自由民主法治國家,非常重視人民言論自由。面對AI發展,政府並不是要限制AI可以回答什麼,而是必須正視大型語言模型究竟使用什麼資料訓練,以及這些資料如何影響AI的回答。

他以二次世界大戰中國戰場為例指出,台灣與中國對於當時中國軍隊主力有不同敘事,但現在不只是中國開發的模型,部分美國大型語言模型也可能出現與中國敘事相近的答案。

林宜敬表示,數發部曾詢問Google、Anthropic等業者,為何使用大量中國資料訓練,而不是更多台灣資料,得到的答案其實很簡單:一是網路上的中國資料量大,而且許多可以免費爬取;二是台灣相當重視智慧財產權及著作權,業者使用相關資料訓練時,會顧慮遭作者提告的風險。

這也正是數發部希望解決的問題。林宜敬說,每當新科技對著作權制度產生巨大衝擊,社會往往需要少則3年、長則10年,才可能逐漸形成共識,但AI發展速度太快,「我們不能等」。如果等到數年後才解決問題,屆時不論中國、美國或針對台灣開發的大型語言模型,在回答問題時,都可能無法充分呈現台灣觀點。

林宜敬舉例,台灣及西方民主社會普遍認為「check and balance」是民主政治的基本原則,媒體則應監督政府;中共官方的政治及媒體觀點卻有所不同。當不同來源的資料大量進入模型,最後也會影響AI如何理解及回答這些問題。

不過,高價值語料背後也涉及著作權爭議。林宜敬指出,各國對AI使用著作進行訓練仍有不同做法,據他了解,新加坡、日本相對開放,歐盟較保守,美國則介於兩者之間,國際間尚未形成一致規範。

他表示,目前國際間討論的重要原則之一,是相關資料不能「原文照抄」,而須經過轉製(transformation)。在著作權規範尚待形成共識的情況下,台灣若一直等下去,台灣觀點恐怕很難透過AI被世界看見。

主權AI語料逾20億Token 下一步鎖定民間出版品

數發部資料創新司司長王復中表示,「台灣主權AI訓練語料庫」自去年12月推動以來,採取「先政府、再民間;先中央、再地方」策略,資料集已從約2000個增加至逾5000個,Token數也從6億大幅增加至逾20億,語料規模成長超過3倍。

目前語料涵蓋民俗、語言、生物、旅遊、出版品、法律、藝術、文化、經濟、地理、交通、醫療及歷史等領域,也逐步納入本土語言,希望讓AI對台灣文化、歷史及不同領域內容有更深入的理解。

王復中說,數發部希望未來詢問AI一本著作時,得到的答案不只是參考外界評論或幾句摘要後形成的簡單回答,而是能真正理解完整作品所要表達的內容,這也是建置台灣主權AI訓練語料庫的重要目的。

隨著政府資料累積到一定規模,下一階段重點將擴展至民間。林宜敬指出,數發部與美國AI開發團隊交流後發現,對業者而言,真正具有高度訓練價值的資料之一,就是出版社正式出版、具有著作權的作品。

他也透露,部分AI開發團隊特別希望取得生成式AI大量普及以前的作品,原因是現在網路上已出現大量AI生成內容,業者不希望再把AI產生的內容拿回去訓練AI,形成循環,因此早期累積的原創著作更具訓練價值。

業者:AI沒有台灣語料太可惜 蛋餅、珍奶都能成養分 

數位時代執行長陳素蘭向《大紀元時報》表示,「台灣的主權AI,這是一個非常非常重要的事情」,AI發展快速,未來會出現大量應用及內容,「我覺得台灣不能在這裡面缺席」。 

Readmoo讀墨執行長龐文真向《大紀元時報》說,「AI如果沒有台灣的語料,那就是太可惜了」。台灣是世界上非常特殊的地方,擁有許多獨特文化,而讀墨累積的資料,也記錄過去10多年台灣出版界的發展。這次特別挑選具有台灣特色的內容,包括台灣歷史、文化、飲食及出版相關資料,希望這些內容真正進入AI的「腦袋」。 

從蛋餅、燒餅、油條、豆漿、飯糰,到珍珠奶茶、手搖飲,再到台灣歷史與出版文化,龐文真認為,這些看似日常的內容,正構成台灣與其他地方不同之處。「我覺得重點是台灣觀點。」她說,台灣的文化與觀點應該進入AI訓練資料,當全世界使用者向AI查詢問題時,才有機會接觸來自台灣的資料與觀點。

自願授權、可隨時退出 數發部邀創作者加入

此次民間語料徵集採「自願參與、明確授權、可退出」原則,創作者並非被強制要求提供作品,未來若情況改變,也可終止相關授權。相關語料可供模型訓練、微調、檢索增強生成(RAG)及知識萃取等用途。

王復中表示,數發部不會對徵集內容本身進行干預,主要由出版社負責內容篩選及品質把關,平台則檢核資料結構、格式及是否能順利供AI訓練使用。

數發部說明,現階段以具豐富語料資源的出版業及電子書平台為主要合作對象,採無償授權方式推動;作者如有意願提供個人著作,可由出版社協助上架至語料庫。

重點徵集內容包括4大類:經同意授權的出版品、出版品簡介、出版品試閱內容,以及已逾著作權保護期間、可作為公共財活化運用的典籍與創作。

林宜敬強調,台灣重視智慧財產權,也必須保障創作者權益,但在全球AI競逐快速推進之際,不能因等待制度形成共識,就讓台灣自己的文化、歷史與觀點缺席於大型語言模型之中。