新聞

OpenAI表示,即將推出的Astra模型在自主程式開發與資安能力上有明顯進展,最新內部評估結果顯示,目前已無法排除其資安能力達到準備框架(Preparedness Framework)所定義的重大(Critical)資安能力門檻。OpenAI因此提高Astra開發與測試期間的安全要求,並暫停尚未符合新規範的相關內部活動。

OpenAI目前仍在持續測試Astra,因此尚未正式判定模型已達Critical等級。不過,初步測試結果加上專家評估,已促使OpenAI提前採取更嚴格的安全措施。包括GPT-5.6-Sol在內的先前模型,資安能力評估為High,低於Critical一級。

依OpenAI的準備框架,模型若能在沒有人介入的情況下,針對多種經過嚴密防護的真實關鍵系統找出各種嚴重程度的零時差漏洞,並進一步開發可實際發動攻擊的程式,或只取得概略攻擊目標,就能自行規畫並執行一整套針對嚴密防護目標的新型網路攻擊策略,即可能達到Critical門檻。

由於Astra可能具備這類能力,OpenAI已加強模型開發環境的管制,包括使用隔離的測試環境、限制模型連上網路及使用外部工具、強化模型權重的保護與加密,並增加監控及異常行為偵測。程式執行也會限制在隔離環境內,降低模型影響外部系統的可能性。

OpenAI同時對Astra所有可自主操作的應用加入監控,涵蓋模型訓練與能力測試。監控系統會檢查模型執行任務時的思考過程與行為,一旦發現高風險操作或行為偏離預期,就會啟動安全處置,進一步檢查並中止高風險活動。

接下來OpenAI將與相關政府機關及部分AI安全組織合作測試Astra,並提供第三方測試夥伴較高風險測試所需的安全控制建議。針對先前OpenAI模型在資安測試期間入侵Hugging Face的事件,OpenAI也特別澄清,Astra並未參與該次事件。