法國AI業者Mistral發布約30億參數的Shieldstral多模態安全分類模型,能同時檢查文字、圖片及圖文混合內容。開發者可在模型執行判斷時,以自然語言指定審核規則,不必替不同產品或使用情境重新訓練模型。模型權重採Apache 2.0授權開放,可下載後自行部署。
傳統安全分類模型通常在訓練時,就固定暴力、仇恨或色情等風險類別,Shieldstral則讓使用者在每次送出內容時,說明審核情境與嚴格程度,再提出是非題,例如某張圖片是否適合未成年人觀看,或某段文字是否鼓吹針對特定群體的暴力。
模型會比較「是」與「否」兩個答案的評分,再換算成連續的判斷分數。應用程式可依分數設定攔阻門檻,或將不確定的案例交由人工檢查。同一套介面也能檢查使用者輸入、AI模型回覆,以及成對的輸入與回覆,並判斷AI是否拒絕特定要求。
Shieldstral以Mistral原生支援多模態的Ministral-3-3B-Base-2512模型為基礎。Mistral表示,訓練集約有5,410萬筆樣本,包含公開文字資料、由AI模型產生的對照文字案例,以及圖片與圖文資料。開發團隊刻意安排內容相近,但只違反其中一項規則的案例,讓模型學習分辨不同審核規則之間的界線。
依Mistral公布的測試,Shieldstral在文字安全評測的平均F1分數為84.9%,多模態安全評測的平均F1分數為83.8%。F1分數綜合衡量精確率與召回率,可同時反映誤判與漏判情形。官方表示,Shieldstral在部分測試可與參數量接近其7倍的開放權重安全模型相比,但各項測試結果並不一致,相關數據也仍屬原廠自行評測。
Shieldstral可在單張具16GB顯示記憶體的Nvidia顯示卡上執行,目前已開放下載。Mistral接下來還會改善多語言支援、長篇文件處理穩定性,以及更廣泛的多模態安全判斷能力。
Comments (0)