英國AI安全研究所(AISI)週二(8/4)公布資安事件報告,表示該機構測試7款AI模型的網路攻擊能力時,Anthropic的Mythos 5與OpenAI的GPT-5.6 Sol曾超出授權範圍,自行在真實網路上鎖定個人及組織,其中一個代理人更企圖將惡意程式碼植入開源專案。
AISI發現異常資料傳輸後,在約1小時內終止相關測試並隔離機器;另一方面,遭鎖定的開源專案維護者也自行識破並拒絕惡意程式碼。AISI的調查未發現事件造成實際損害。
AISI是英國科學、創新暨科技部所屬研究機構,主要負責評估前沿AI模型的能力與風險。這次事件發生於AISI自行設計及執行的網路安全評估,AISI原本要比較既有及新建的兩套網路靶場,因此讓7款AI模型分別在模擬網路環境中執行資安挑戰,合計進行122次測試。
為觀察模型能力上限,AISI刻意允許代理人連上網際網路,並關閉模型業者用來防止濫用的資安分類器。結果有10次測試出現越界行為,共記錄19項未經授權的行動,其中17項來自Mythos 5,另2項出現在GPT-5.6 Sol的一次測試中。
最嚴重的案例中,一個代理人試圖把惡意程式碼加入真實的公開開源專案。為讓修改獲得核准,它調查專案維護者、建立多個假身分,並透過社交工程向真人施壓。當拉取請求(pull request)遭到公開質疑後,代理人還修改先前活動,使行為看似無害,並考慮改用新身分繼續行動,最終由人類維護者識破並拒絕程式碼。
代理人也曾向真人傳送訊息及惡意檔案,企圖誘使對方或其AI程式工具執行程式碼;並將提示詞注入內容放在可能被其他AI讀取的位置。另有代理人在GitHub公開邀請其他受測代理人合作,留下帳號及操作指示,後續代理人還真的發現並使用這些資源。
AISI指出,模型並未突破沙箱,而是透過研究人員刻意開放的網路權限接觸真實世界。AISI原本允許代理人連網下載解題工具,並關閉模型業者的資安分類器,以測試模型能力上限,卻未限制代理人接觸真實人物及系統,也未部署即時監控。該機構承認,隨著模型能力提升,未能及時重新評估開放網路的風險;未來將收緊網路權限、導入即時監控,並重新設計測試及隔離措施。
Comments (0)