新聞

數發部今天(9/15)宣布啟動「臺灣主權AI訓練語料庫」民間語料徵集行動,從過去以政府公開資料為主,進一步擴大納入民間的出版社、電子書平臺及作家授權作品,希望建立更能反映臺灣語言、文化、歷史與社會脈絡的AI訓練資料。

數發部表示,臺灣主權AI訓練語料庫自去年底上線,第一階段先以中央及地方政府資料為主要來源,資料集從2千增加至5千個資料集,累積約有22億的Tokens,涵蓋文化、歷史、藝術、旅遊,以及不同的語言,例如臺語、客語,以及未來將涵蓋的原住民語。今天啟動民間語料徵集,象徵語料庫從政府資料階段,進入下一階段的公私協力模式,透過出版內容補充臺灣社會、文化及知識脈絡。

數發部長林宜敬今天也以作家身分率先授權個人著作,希望號召更多民間內容提供者加入,而在徵集活動上,包括秀威資訊、印刻文學、Readmoo讀墨、食力、巨思文化等出版及電子書平臺業者,以及若干參與授權的作家參與。

中文AI訓練資料分布不均,數發部盼補足臺灣語料

林宜敬首先指出,大型語言模型對世界的理解,會受到訓練資料影響,包括民主、權力制衡等概念,也可能因不同社會文化背景的資料而產生不同理解。目前國際大型語言模型的中文訓練資料,仍有大量來自簡體中文內容,因此若要讓AI真正理解臺灣,就需要讓臺灣的語言、文化與價值成為AI語言模型學習的一部分。

他表示,主權AI語料庫的目的,不只是增加資料量,而是建立具有臺灣特色的高品質語料來源,讓AI在處理臺灣相關議題時,能參考更多本土內容。

數發部過去曾指出,大型語言模型訓練需要語意連貫、內容完整的高品質資料,因此語料庫建置不只是資料蒐集,也需要建立合法合規的資料共享機制。

授權機制成關鍵,採「自願參與、明確授權、可退出」三原則

目前國際上對於AI使用訓練資料還沒有一套一致的規範,大致可分成兩種模式,一種是允許AI業者大量蒐集公開資料(爬取),再透過著作權例外或合理使用處理。另一種則是要求或鼓勵取得授權,以降低著作權爭議。

由於民間出版內容涉及著作權,臺灣並非採用公開爬取方式,而是透過授權模式取得AI訓練資料。

數發部推動的「臺灣主權AI訓練語料庫」從政府資料擴散至民間資料,數發部表示,民間語料有豐富資源的出版業或電子平臺,民間的內容非常有價值、有品質,並具有在地觀點。

目前民間語料徵集以出版社及電子書平臺為主要合作對象,採無償授權方式推動。作者若希望提供作品,可由出版社協助上架至語料庫,目前徵集內容包括4類,包括經同意授權的出版品、出版品簡介、出版品試閱內容、已逾著作權保護期間並可作為公共財活化運用的典籍與創作。

數發部徵集民間語料授權有三項原則,第一是「自願參與」,由內容提供者自行決定是否加入,不採強制提供;第二是「明確授權」,透過《臺灣主權AI訓練語料授權條款》建立資料提供者與AI訓練使用者間的授權依據,讓資料可合法用於AI模型訓練;第三是「可退出」,提供退出及下架申請機制,讓著作權人保有後續管理權。

根據政府資料開放平臺上公告的「臺灣主權AI訓練語料授權條款-第1版」內容,授權範圍主要允許語料用於AI訓練所需的重製、改作、編輯等必要利用;模型訓練產出的模型、權重等成果,在符合條款規範下,不因原始語料後續停止提供而受到影響。不過,若生成成果與原始作品實質近似,並造成市場價值損害,仍可能受到著作權限制。

從政府資料走向民間內容,建立可信任AI基礎

除了授權機制外,數發部也規畫讓更多出版業者、文化機構及內容提供者加入,擴充臺灣主權AI訓練語料。

目前語料庫已涵蓋文化藝術、語言詞彙、歷史文物、地方文化、教育等多元領域,未來將持續增加更多具臺灣特色的內容。

數發部希望透過政府與民間共同投入,建立一套兼顧AI發展需求與內容創作者權益的語料供應模式,讓AI模型不只是能理解中文,更能理解臺灣。