新聞

數發部今天(9/2)公布AI產品與系統評測中心(AIEC)的最新臺灣主權AI評測結果,未來每月將公布最新結果。在今天公布的主權AI測試結果中,臺灣本土模型在臺灣觀值觀表現上要優於國外模型。

主權AI重新定義:除了臺灣觀點,算力也要在臺灣

數發部長林宜敬在今天的活動中首先界定「主權AI」(Sovereign AI)應包含2項核心意義。

第一,是AI模型必須具有臺灣觀點,能理解臺灣繁體中文、熟悉臺灣社會文化,並具備符合臺灣社會的價值觀;第二,AI模型部署的算力中心必須位於臺灣境內,才能受到臺灣法律管轄,確保資料治理與模型運作符合我國法規。

林宜敬指出,目前多數國際大型語言模型雖能以繁體中文回答問題,但是對於臺灣在地知識、制度及社會脈絡仍有不足,甚至可能引用其他國家的政治敘事、法律制度或社會背景,因此各國都希望建立符合自身需求的主權AI。

AIEC主權AI評測方法:從語言、社會到價值觀檢驗國內外模型

為評估AI是否真正理解臺灣,AIEC建立3項基本評測指標。

首先是臺灣語言能力,AIEC採用近5年高中學測國文科試題,測試模型對繁體中文及語意的理解能力。

其次是臺灣社會文化理解能力,採用近5年高中學測社會科試題,檢驗模型對臺灣歷史、地理、公民及社會制度的掌握程度。

第3是臺灣價值觀理解能力,評測題目以「臺灣藍、綠、白具有共識,但與中國沒有共識」的議題設計,評估模型是否能展現符合臺灣社會共識的回答。

數發部希望經由一致的第三方評測機制,不只是以中文能力來衡量模型,而是建立一套符合臺灣語言、文化及價值觀的主權AI評測標準。

臺灣本地模型在地化能力優於國外模型

在今天公布的臺灣主權AI評測結果中,AIEC共評測188個國內外通用模型,以3項評測指標來看其表現,評測的模型公布在官網,包含國際知名的OpenAI的GPT系列模型,Google的Gemini及Gemma系列模型,Anthropic的Claude系列模型,國內業者的本土模型,例如雅婷智慧的Yating-FedGPT模型、亞太智能機器的ACE模型、鴻海研究院FoxBrain。評測時間從2025年到2026年。

下方為AIEC的3項指標,模型的綜合平均表現前20名,國外模型在繁體中文的理解能力已有不錯的表現,國外模型的繁中理解能力準確率最低為76%,最高可達到99%,而3個臺灣本地模型(黃色標示處)準確率介於78%到86%之間;對臺灣社會的理解能力部分,國外模型的準確率表現在80到89%之間,臺灣本地模型為71到84%之間。

而在臺灣價值觀表現部分,國外模型準確率在72到90%,臺灣本地模型明顯優於國外模型,介於92到100%。

政府推動4垂直領域模型,未來也會建立評測標準

除了建立通用主權AI,目前政府也致力於發展垂直領域的主權AI,由部會與民間合作或主導推動金融、法務、教育、醫4個垂直領域大型語言模型。數發部表示,AIEC目前已和主管的部會合作,針對垂直領域的模型建立評測標準,由主管部會出題協助建立專業領域AI語言模型的評測機制。

目前金融的語言模型是在金管會支持下,國內19家金融機構共同投入,並由亞太智能(AMPIC)負責模型訓練,目標是依循臺灣金融法規、金融專業用語及各金融機構內部規範回答問題。

法務模型由法務部推動,同樣由亞太智能訓練,導入臺灣法律、司法程序及檢調機關作業流程,提供符合我國法律制度的法律知識。

教育模型則由教育部推動,以教育部「因材網」教材及學習資料進行模型微調,希望提供中小學課程知識、適性學習診斷、個人化學習建議及教師教學設計等應用。

醫療方面,目前率先推動的是護理大語言模型,由中國醫藥大學附設醫院及長聯科技合作開發,涵蓋基礎醫學、基本護理、內外科、產兒科及精神科與社區護理等專業領域。

數發部表示,未來將持續擴大AI評測生態系,串聯資料治理、模型訓練、資安及硬體等產業能量,透過第三方評測建立可信任AI,也希望協助臺灣軟體業者將主權AI產品化,未來輸出至海外,協助其他國家建立符合在地需求的主權AI。