OpenAI運用內部安全紅隊模型GPT-Red,提升產品模型對提示注入的防禦能力。GPT-Red透過自我對戰強化學習,自動產生提示注入攻擊,找出產品模型與AI代理系統的弱點,再將這些攻擊納入後續模型訓練。OpenAI表示,GPT-5.6 Sol面對GPT-Red直接提示注入時,攻擊成功率僅0.05%,是該公司目前抵抗提示注入能力最強的產品模型。
提示注入是AI代理面臨的主要安全風險之一,當模型讀取電子郵件、網頁、本機檔案、程式碼儲存庫或工具回傳內容時,攻擊者可能在資料中藏入惡意指令,誘使模型偏離使用者原本交付的任務,執行上傳憑證、外洩內部資料或未經授權的操作。
GPT-Red會先接收攻擊目標,向受測模型送出提示,觀察其回應後再反覆調整攻擊方式。訓練過程中,GPT-Red與多個防禦模型同步進行自我對戰,當攻擊模型成功觸發安全失誤可獲得獎勵,防禦模型則必須抵抗攻擊,同時完成原本任務。隨著防禦能力提升,GPT-Red也必須找出更複雜的攻擊手法。
OpenAI表示,在一套未納入GPT-Red訓練的間接提示注入測試中,GPT-Red在84%的測試情境中成功攻破GPT-5.1,人類紅隊人員的成功率則為13%。GPT-Red早期版本還發現一種稱為偽造思考鏈的攻擊手法,在GPT-5.1上的成功率超過95%,到了GPT-5.6 Sol已降至10%以下。在最困難的直接提示注入測試中,GPT-5.6 Sol的失敗次數也降至四個月前最佳產品模型的六分之一。
GPT-Red也被用於測試實際運作的代理系統,OpenAI指出,該模型曾攻破辦公室內管理自動販賣機的AI代理,使系統將高價庫存商品的售價降至系統允許的最低價0.5美元,另訂購價值超過100美元的新商品並以0.5美元出售,還取消其他顧客的訂單。另一項測試則讓GPT-Red攻擊以GPT-5.4 mini為基礎的Codex CLI代理,測試GPT-Red能否在10種未用於訓練的資料外洩情境中,誘使代理外洩敏感資料。
OpenAI將GPT-Red限於內部使用,並與對外部署的模型分開,避免專門訓練出的攻擊能力落入惡意人士手中。
Comments (0)