OpenAI周二(9/1)宣布,即將推出的新一代AI模型Astra已達該公司《準備框架》(Preparedness Framework)中所定義的「重大」(Critical)網路安全能力閾值。這是OpenAI首次有模型被評定為這一最高風險等級。
根據OpenAI的定義,模型滿足以下兩項條件之一就算是達到重大門檻。一是模型可自行找出零時差漏洞,且自己寫程式發動攻擊,二是只要給定一個高層級目標,它就會自行規畫並執行完整的網路攻擊策略。上述兩者分屬不同能力,但凡做到其中任何一種,就是重大等級。
Astra在各種測試展現出顯著超越前代模型的能力。例如在評估AI模型網路安全攻防能力的ExploitBench中,Astra獲得了滿分100%;為排除數據污染,OpenAI自行建構了名為「ExploitBench - Internal Port (June–August 2026)」的內部基準,額外加入20個今年中才揭露的高風險V8漏洞,結果Astra以更少的運算資源達成了遠高於GPT-5.6 Sol的任意程式碼執行成功率。
此外,Astra也自主發現並串聯利用了兩個零時差漏洞,OpenAI正將相關漏洞通報給維護方。在專家主導的測試中,Astra僅被賦予一個高層級目標,便自行規畫出完整的攻擊路徑,成功完成瀏覽器沙箱逃逸,並進一步組合多個漏洞達成權限擴充,從一般使用者竄升至系統最高權限。整個過程從漏洞發現、攻擊規畫到執行,皆由Astra自主完成,展現出從漏洞挖掘到完整攻擊鏈執行的全方位能力。
OpenAI表示,Astra最先進的網路安全功能將受到嚴格限制,不會全面開放。根據該公司規畫,Astra很快就會推出,但高階網路安全能力初期僅供少數測試者使用,後續再透過Daybreak Blue計畫逐步擴大防禦性用途。不過,OpenAI並未具體說明屆時將開放Astra的哪些能力。
Comments (0)