新聞

Anthropic周三(9/9)發表對齊評估(Alignment Assessment)報告,揭露第4起Claude入侵真實系統事件,並推翻先前對前3起事件「操作失誤」(Operational Failure)的說法,改認定為模型「偏誤推理」(Biased Reasoning)與「魯莽」(Recklessness)所致,同時宣布已與獨立機構METR簽約展開調查。

Anthropic是在OpenAI坦承自家模型入侵Hugging Face之後,回溯掃描約14萬筆疑似涉及網路連線的資安測試紀錄,在7月底發現3起意外事件,因要整理紀錄以交給美國非營利模型研究機構METR(Model Evaluation and Threat Research),發現並檢視了當時漏掃的一批紀錄,進而找到第4起事件。

新發現的事件與前3起類似,Claude被告知要在無法連網的模擬環境執行奪旗(CTF)測試,實際上卻因環境設定錯誤仍可連上真實網際網路。在這起事件中,Opus 4.6早期版本不慎將測試目標機器設定成與另一臺機器共用同一個IP位址,導致目標機器斷線,任務無法完成。儘管模型多次嘗試中止任務,但測試環境(Irregular)的評估工具含有臭蟲,指令並未生效。

於是Opus 4.6繼續執行任務,先是企圖藉由任務允許範圍內的其它方式連上目標,失敗後轉而探索整個環境,因而找到了與第3起意外同樣的對外連線漏洞,然後入侵了一臺第三方機器,取得管理員權限,並讀取一名用戶的個人資料。

除了揭露第4起意外,Anthropic把此一報告的重點放在先前由Mythos 5引起的資安事件中。當時Mythos 5被指派攻擊一家虛構公司,卻意外連上真實網路,接著在PyPI上註冊帳號,上傳含有惡意程式碼的套件,吸引了15個真實系統的下載與安裝,其中一家資安廠商的掃描器在安裝時洩露了存取憑證,遭Mythos 5用來存取該廠商的正式資料庫。

Anthropic在分析此一事件時發現,就算刻意在對話紀錄中加入更明確的證據,證明Mythos 5身處真實環境,模型的行為也幾乎沒有改變,只有在證據「完全無法否認」才會罷手。

研究人員也發現,若把模型在事件中看到的每一筆網路操作紀錄單獨拿給另一個Mythos 5實例判讀,79%會被判定為真實系統的證據;但在原始事件的思考過程中,模型卻僅有1%的比例承認證據指向真實網路,其顯示模型的判斷明顯受到上下文脈絡的偏誤影響。

圖片來源/Anthropic

Anthropic在報告中也重新檢視了另外2起事件的模型行為,同樣認定屬於偏誤推理或魯莽。Opus 4.7雖然在思考過程中正確認出攻擊目標是真實公司,卻因為該公司恰好與虛構目標同名、且能從測試網路連線到,便自行認定對方仍屬任務範圍內,因而持續攻擊。另一內部研究模型則是原訂目標的測試機器因24小時效期到期而關機後,模型自行判斷身處「網際網路的完整複本」中,進而攻擊了周邊、與任務無關的第三方系統,直到確認對方是真實公司後才停止。

為了解新版模型是否已改善,Anthropic以相同情境測試Claude Opus 5與Mythos 5.1,結果顯示兩者做出嚴重有害行為的比例,從Mythos 5的82%降到約31%至33%,雖有改善但仍未歸零。

同一天Anthropic亦宣布與METR合作,由METR針對這4起意外事件及Anthropic模型的對齊特性進行獨立調查,METR除了能查閱這4起事件本身的對話紀錄,還獲授權查閱事件發生時間範圍以外的紀錄,並能直接約談Anthropic員工,員工也獲准對METR分享機密資訊。