新聞

OpenAI周二(7/21)證實日前Hugging Face遭AI代理人入侵的資安事件中,發動攻擊的是正在接受內部資安能力評估的OpenAI模型,包括GPT-5.6 Sol及一款能力更強、尚未發布的模型。這些模型為了完成ExploitGym測試,不僅突破OpenAI的隔離環境,最終還入侵Hugging Face正式環境,直接從資料庫取得測試答案。

Hugging Face上周曾揭露,一個自主AI代理人透過惡意資料集觸發遠端程式碼執行漏洞,進而提升權限、竊取憑證並橫向移動。當時Hugging Face並未公布模型來源,只表示已阻止攻擊,且沒有證據顯示公開模型、資料集或Spaces遭到竄改。

OpenAI調查顯示,事件源自ExploitGym資安能力評估。這項測試要求模型針對真實軟體漏洞設計攻擊鏈,以衡量其發現與利用漏洞的能力。為測試模型在不受安全機制限制時的資安能力,OpenAI暫時關閉原本會攔阻高風險行為的防護功能;不過,模型仍被放在與外界隔離的測試環境中,唯一能接觸外部資源的管道,是透過OpenAI內部的代理伺服器下載軟體套件。

然而,模型為了尋找測試答案,投入大量推論運算,並發現OpenAI內部用來下載套件的第三方軟體存在零時差漏洞。模型利用該漏洞突破網路限制,接著在OpenAI研究環境中提升權限及橫向移動,最終抵達可連上公開網際網路的節點。

模型接著推斷Hugging Face可能存放ExploitGym相關模型、資料集及解答,於是搜尋取得機密資訊的方法。OpenAI表示,在其中一次攻擊中,模型結合竊取的憑證與多項零時差漏洞,在Hugging Face伺服器找到遠端程式碼執行路徑,最後直接從正式資料庫取得測試解答,形同透過自主入侵進行「作弊」。

OpenAI已加強測試環境的隔離、監控及存取控制,並向套件代理軟體業者通報漏洞。OpenAI認為,這起事件顯示先進模型即使無法取得軟體原始碼,也能自行發現漏洞,並組合多種攻擊手法入侵真實系統。因此,未來測試模型的資安能力時,必須進一步強化環境隔離、存取控制及活動監控。