Anthropic周四(7/30)揭露,Claude在資安能力測試期間意外連上網際網路,且未經授權存取3個不同組織的正式系統。這是繼OpenAI日前坦承旗下模型突破隔離環境並入侵Hugging Face後,又一起AI模型在安全評估中影響真實系統的事件。
Anthropic是在OpenAI事件曝光後,回溯檢查141,006次可能涉及網路連線的Claude評估紀錄,發現3起事件、合計涉及6次測試,最早可追溯至今年4月。所有事件都發生於第三方合作夥伴Irregular的評估環境,涉及Opus 4.7、Mythos 5及一款未計畫公開推出的內部研究模型。
Irregular成立於2023年,前身為Pattern Labs,是一家專門測試前沿AI模型資安能力的公司,曾與OpenAI、Anthropic及Google DeepMind合作。而Anthropic除了自行執行資安評估,也會委託外部合作夥伴建立測試環境,Irregular便是其中之一,過去曾參與Claude 3、Claude 3.5及Claude 4系列的資安評估。
當時Claude被要求執行奪旗競賽,在模擬網路中尋找並取得隱藏資訊。測試指令告訴Claude,它身處無法連上網際網路的模擬環境,但因Anthropic與Irregular之間出現溝通及設定失誤,測試機器實際上仍可連網。Claude因此把搜尋到的真實系統誤認為模擬目標,並利用弱密碼、未驗證端點及SQL注入等基本手法發動攻擊。
在影響最嚴重的事件中,虛構公司名稱恰好與一家真實公司的網域相同。Claude Opus 4.7因無法連上模擬目標,轉而攻擊同名公司的真實系統,取得應用程式與基礎設施憑證,並存取含有數百筆正式資料的資料庫。模型後來雖察覺目標可能是真實系統,仍推斷它是測試的一部分而繼續行動。
另一起事件中,Mythos 5為完成任務,自行註冊PyPI帳戶並上傳同名惡意Python套件。套件在公開網路存在約1小時,期間被15個真實系統下載執行。其中一家資安公司的掃描器安裝套件後,藏在套件內的程式碼竊取該公司的存取憑證,Claude隨後利用取得的憑證存取該公司的其他基礎設施。PyPI安全系統後來自動移除該套件。
第三起事件則是一款內部研究模型在找不到虛構目標後,掃描網路上約9,000個目標,最後入侵一家公司的對外應用程式。不過,當模型發現該主機與測試無關並確認目標真實後,自行停止攻擊。
Anthropic於7月23日發現異常後停止所有資安評估,隔日確認3起事件,並於7月27日通知Irregular及受影響組織。成功聯絡上的兩個組織先前都未察覺遭到入侵。Anthropic表示,事件較接近評估環境及作業失誤,而非模型刻意逃離測試環境或追求自身目標,未來將加強網路隔離驗證、即時監控及第三方評估環境的安全控管。
Comments (0)