新聞

湯森路透(Thomson Reuters)推出首款自研大型語言模型Thomson。湯森路透是一家提供法律、稅務、會計與新聞等專業資訊服務的內容與科技公司,旗下包括Reuters新聞業務。該公司投入約4,000萬美元訓練Thomson,費用包含人才與運算資源。

Thomson以既有開放模型為基礎,再利用湯森路透累積的專業資料進一步訓練及調校,希望降低模型實際提供服務時的運算成本,並減少對外部模型供應商的依賴。

Thomson使用的專業內容來自Westlaw法律資料庫、Practical Law法律實務資料庫、Checkpoint稅務與會計資料庫,以及Reuters新聞等服務,並有數百名各領域專家參與訓練目標設計與模型評估。目前用於訓練Thomson的內容,仍不到湯森路透自有資料的10%。

Thomson目前以Snowdon作為基礎模型,Business Insider引述湯森路透技術長Joel Hron指出,Snowdon是以阿里巴巴Qwen開放模型為基礎調整而成,湯森路透再以自身的專業資料與領域知識,在Snowdon之上訓練Thomson。湯森路透並非從零開始建立大型語言模型,而是利用既有開放模型作為底層,再針對法律等專業工作進一步訓練。

成本是湯森路透自建模型的考量之一,Joel Hron接受Business Insider訪問時表示,開發自有模型有助降低長期使用第三方模型的成本。Thomson未來會接手部分原本由Claude處理的工作,不過湯森路透仍會依不同工作搭配Thomson與其他大型語言模型。

Thomson首波部署在湯森路透旗下法律AI助理CoCounsel Legal,首先用於其中的表格分析(Tabular Analysis)功能,協助法律人員一次檢視大量文件,並把不同文件的分析結果整理成表格。湯森路透也規畫將Thomson逐步擴展到其他法律與稅務產品。

湯森路透表示,內部評測顯示Thomson在部分法律與一般任務的表現可與主流大型模型相比,不過目前相關結果主要仍來自公司自行測試。湯森路透已開放部分法律與AI學者進行外部評估,也將提供較小型的Thomson開放權重版本,供學術與非商業用途測試。