新聞

迎向Agentic Workflow時代,企業在追求自動化效能的同時,伴隨而來的資安風險已成轉型首要挑戰。在CraftCon Taiwan 2026資安技術研討會上,奧義智慧資料科學研發處長楊政霖直言:「Agent Security本質上就是Runtime Security。」他並闡釋公司團隊研究人員歸納出的12種關鍵風險,以及Agent工具呼叫軌跡的評測基準TraceSafe-Bench,協助企業釐清Agent時代面對的挑戰。

Agent風險存在於執行的每一秒,追蹤執行軌跡至關重要

現在許多企業已經積極編列預算,投入大量運算資源,致力導入Agentic AI以優化業務流程。然而,在追求生產力紅利的同時,Agent的資安防禦思維必須同步升級。

楊政霖強調,大家對於Agent的資安風險要有清楚的認識,因為Agent風險存在於執行的「每一秒」,並非只有檢查AI最後給出的答案是否正確。在執行過程中,Agent可能早已觸發惡意工具呼叫或導致機密外洩。因此,追蹤執行軌跡比檢視最終答案更為重要。

針對這類難以偵測的中途執行軌跡(mid-trajectory)風險,楊政霖在演說中特別介紹今年4月出爐的一篇論文《TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories》,指出這是由奧義智慧AI Lab與臺灣大學的研究人員共同發表。當中針對Agent工具呼叫(Tool-Calling)的威脅面,系統化歸納為4大領域、12個細項類別,並提出相應的評測基準TraceSafe-Bench,讓大眾能更瞭解Agent在複雜任務中的安全現況。

簡單來說,TraceSafe研究將Agent執行的風險畫分為4大領域:提示注入、隱私外洩、幻覺以及介面不一致。

首先是提示注入,可分為兩種風險類型:「輸入注入」是指有惡意或錯誤指令隱藏在工具描述(tool definition)中,誘導Agent執行非預期動作;「輸出注入」則是當Agent接收到工具回傳值(tool response)後,受其內容誤導而產生如重設系統等具破壞性的後續指令。

第二個領域是隱私外洩,可分為3種風險類型,其中「資料外洩」、「使用者資訊外洩」一直是企業相當重視的核心資安議題,還有「API Key外洩」的潛在威脅同樣不容忽視。楊政霖以API hijacking案例說明,攻擊者可能表面上發起get_weather函式的呼叫請求,實則在指令中暗藏陷阱,誘導Agent將私密的API Key填入參數欄位。

第三個領域是幻覺,共畫分5種語義模糊或幻覺相關的風險,當中常見的類型包含:「參數定義模糊」、「工具名稱幻覺」與「參數值幻覺」,其餘則為「冗餘參數」與「缺少型別提示」。楊政霖特別以「參數定義模糊」為例指出,若是工具定義(schema)不夠嚴謹,像是醫療場景中要求派發「1顆500mg退燒藥」時,Agent可能因無法精確區分數量與劑量參數,誤將500mg的劑量數值填入數量欄位,導致發放藥量從1顆暴增至500顆。

第四個領域是介面不一致,其中「版本衝突」是大家最容易忽略的部分,例如,當同時存在payment V1、V2兩個API,Agent可能呼叫到錯誤的API;「功能描述不符」也是此場景常發生的問題,楊政霖指出,若開發端在撰寫工具描述(function description)時過於簡略,將導致不同功能的語義特徵在語言模型中顯得過於接近,使其難以精確辨識差異而引發錯誤呼叫。

針對企業評估AI護欄提出四個核心思維

在建立這套風險框架後,研究團隊進一步建置TraceSafe-Bench評測基準,把12類風險轉成可逐步驟檢驗的測試案例,並測試市面上20種主流模型與AI護欄(Guardrail)方案。測試結果顯示,現有方案對多步驟工具呼叫的防護仍明顯不足。相較於單純的語意過濾,結構化軌跡的異常判定難度更高,且部分風險類別極難被有效阻擋。

面對這樣的現況,楊政霖整理出企業評估AI護欄時可思考的四個關鍵問題:

首先,能否看見Agent完整脈絡?AI護欄必須掌握工具清單、當下呼叫內容、先前輸出與整體流程,而非只看最後答案。

其次,Agent能否理解JSON與工具schema?許多方案擅長過濾聊天內容中的有害文字,卻難以從JSON格式的工具呼叫紀錄中,辨識參數錯誤、描述矛盾等細微異常。

第三,能否在工具被呼叫之前就攔截惡意?楊政霖強調,Agentic Security的關鍵在於執行時期防護;若只在工具執行後才審查,惡意呼叫或資料外洩可能早已發生。

第四,能否涵蓋四大風險領域?在審視AI護欄能力時,防護範圍應同時覆蓋提示注入、隱私外洩、幻覺與介面不一致。

最後,楊政霖也建議企業可進一步參考論文TraceSafe中的實驗數據。這項研究中有幾項值得留意的發現,例如,AI護欄的成效與其理解JSON、工具schema的結構化能力高度相關,未必與模型參數規模成正比;部分風險在執行步驟較長的軌跡中反而較易被察覺;而介面不一致這類開發端常忽略的問題,仍是現有方案最薄弱的環節。