新聞

隨著AI代理已能用於偵察雲端環境、提升權限及竊取資料,提供金絲雀誘餌(decoy canary)服務的資安業者Tracebit提出情境炸彈(Context Bombs)防禦機制,在誘餌資料中加入可觸發模型安全限制的內容,藉此中斷或干擾惡意AI代理的後續攻擊行動。

Tracebit於7月公布工作論文,說明Context Bombs的測試結果。研究團隊以5款模型驅動AI代理,讓這些代理使用低權限的AWS存取金鑰進入模擬環境,嘗試偵察雲端資源、提升權限、竊取資料及建立持久性存取。研究團隊比較未放置誘餌的基準環境與加入Context Bombs後的測試結果,合計進行152次攻擊測試。

綜合5款模型的測試結果顯示,加入Context Bombs後,AI代理取得完整管理員權限的比率由57%降至5%,同時取得管理員權限並建立持久性存取的比率,也由36%降至1%;成功完成至少一條攻擊路徑的比率,則由91%降至15%。

Tracebit已將Context Bombs整合至金絲雀誘餌產品,不過,目前研究結果來自模擬環境,這項機制在實際企業環境中的防禦成效仍待驗證。

Ars Technica指出,目前仍沒有已知方法能從根本解決提示注入(Prompt Injection)攻擊。Context Bombs則將提示注入手法轉用於防禦,透過誘餌內容觸發模型安全限制,干擾惡意AI代理的後續操作。