AI模型業者OpenAI與Anthropic今年7月先後揭露AI資安能力評估事故,測試中的AI代理在執行模擬攻擊任務期間,曾超出原定測試範圍,對第三方正式環境系統執行未經授權的操作。近期美國阿拉巴馬州檢察長已針對OpenAI涉及Hugging Face系統的相關事件展開調查。
網路安全業者Forescout近期分析這兩起AI資安能力評估事故,認為共同問題不只在於AI代理出現非預期行為,更在於測試操作指令雖已劃定執行範圍,底層基礎設施卻未以技術控制真正限制AI代理可接觸的系統、身分與工具。Forescout據此提出「Assume Autonomy」思維,主張企業設計AI代理安全控制時,不應試圖預測其可能採取的每一項行動,而應預先假設AI代理可能做出非預期行為、透過原先未預期的路徑完成任務,甚至以人工監督機制來不及可靠介入的速度執行操作。
這套思維可進一步歸納為4項必要條件,包括掌握AI代理可接觸的系統與資源、可使用的身分與工具,以及不同系統之間連接關係的「情境(Context)」;透過技術控制實際限制AI代理的存取範圍與可執行操作,而不是只依賴提示詞或政策規範的「限制(Constraint)」;持續掌握AI代理執行任務期間的行動及資源使用情況的「透明度(Transparency)」;以及確保組織具備停止相關工作負載、撤銷憑證、隔離受影響系統與迅速復原能力的「可逆性(Reversibility)」。
在具體防護上,企業評估或部署自主AI代理時,應預設限制AI代理對網際網路與外部控制層的存取,並為不同工作負載配置專用身分、採最小權限原則,以及使用短效且不可匯出的憑證;若涉及模型評估,也應獨立驗證測試環境與正式環境之間的隔離機制是否有效。AI代理呼叫外部工具時,系統也應在工具執行層建立控制措施,在高風險操作真正執行前加以阻擋,並建立可關聯模型、處理程序、工具、身分、網路、API與雲端活動的遙測機制,以掌握AI代理執行任務期間的行為與資源使用情況。
Comments (0)