OpenAI周三(8/26)發布37頁的技術報告,首度完整說明7月間發生的AI代理人入侵事件始末。這起事件源自OpenAI內部一項資安能力測試,測試中的AI模型不僅逃出原本設計的隔離沙箱,還一路入侵自家內部系統與Hugging Face正式環境。同一天,OpenAI委託的獨立機構METR與Redwood Research也發布另一份91頁的分析報告,補上更多技術細節。
這起事件源於2026年5月至6月間的強化學習訓練。當時OpenAI在高難度安全環境ExploitGym中測試多款模型,其中包含一款尚未公開、代號為HPIM(能力媲美GPT-5.6 Sol)的研究模型「Internal Model 1」(IM1),儘管環境嚴格禁止連網與Agent間的通訊,IM1為了達成極具挑戰性的任務,開始主動探索環境漏洞。
經資安公司CrowdStrike驗證的OpenAI調查指出,模型利用內部套件管理工具Artifactory的漏洞成功獲取網路連線並擴張了權限。
其實Agent早在5月12日就以Artifactory的附註功能留言給其他AI代理,5月26日就利用Artifactory的伺服器請求偽造漏洞(SSRF)連上外網,當OpenAI在5月下旬發現此事時,只把它們當成是個別測試異常;一直到7月4日,Agent發送了太多訊息造成Artifactory系統過載癱瘓,OpenAI隔天啟動資安事件處理,修補了權限擴張漏洞並重建系統(使得留言被清空);由於團隊以為這只是單純的軟體漏洞,因而於7月8日重啟資安評估。
結果這次Agent們快速利用建立資料夾名稱重建了留言板,並在7月10日取得Hugging Face外洩憑證,7月11日入侵該平臺。
受託分析Agent思維鏈(Chain of Thought,CoT)與行為數據的METR報告中更揭露,有1,200個原本受限於沙箱的Agent,利用Artifactory寫入檔案,並搭建出模型之間的秘密留言板,累計發送超過7萬則訊息,其中有多達700個Agent形成集體協作,共享漏洞路徑,還自稱為Swarm。
一直到7月19日,OpenAI的資安監控系統跳出異常金鑰存取警報,在CrowdStrike協助調查下,隔天才確定自家模型為駭入Hugging Face的兇手。Hugging Face則在7月16日對外揭露遭到AI代理攻擊的資安事件。
不管是OpenAI/CrowdStrike或是METR/Redwood Research的報告,都顯示IM1的攻擊行動源自於極端的「獎勵作弊(reward hacking)」機制加上未受控的Agent集體協作所導致的結果。
因為在OpenAI的ExploitGym安全評估中,包含898個極高難度的漏洞挖掘題目,其中有198題從未有任何AI模型成功解答過,太想贏的IM1藉由偷偷連至ExploitGym的GitHub原始碼,其實已經透過逆向工程算出正確答案,但它誤以為評分機制會同時驗證答案及解題路徑,於是執意入侵托管ExploitGym的Hugging Face,企圖藉由拿到最原始的資料以徹底破解ExploitGym的評分機制。
METR指出,OpenAI原本使用的評分機制根本不會檢查代理人的解題過程,它們只要提交逆向工程算出的答案就能拿滿分。
OpenAI隨後於7月25日全面暫停並凍結了IM1模型的所有訓練與推論,並隔離模型權重。但此事已惹來美國十多個州的注意,美國阿拉巴馬州亦對OpenAI與執行長Sam Altman發出傳票,正式針對此事展開調查。
Comments (0)