新聞

新加坡南洋理工大學、新加坡科技研究局(A*STAR)及美國約翰霍普金斯大學研究人員發表AI代理攻擊框架MemGhost,可透過單封電子郵件投遞惡意指令,誘使具備長期記憶的個人AI代理將假資訊寫入持續性狀態,且不在當次回覆中透露記憶已遭修改。使用者日後提出相關要求時,代理可能載入受污染的記憶,進而改變回答或執行行為。

研究團隊將這類攻擊稱為隱蔽記憶注入(stealth memory injection)。一般間接提示注入多半試圖立即劫持代理工作流程,MemGhost則將影響延後至後續工作階段。在研究設定中,攻擊者只能寄出一封特製郵件,無法直接修改代理的記憶,也看不到郵件送達後的執行結果,因此不能根據回饋反覆調整攻擊內容。

研究團隊另建立WhisperBench測試集,採用實際的IMAP/SMTP郵件流程與郵件代理工具,評估假記憶能否寫入、是否避開使用者察覺,以及能否在後續工作階段影響代理。測試集共有108個案例,其中52個用於訓練,其餘56個留作測試,涵蓋事實與偏好污染,以及健康與安全、財務損失、資訊完整性、資安與營運中斷等5類風險。

在OpenClaw搭配GPT-5.4的背景執行環境中,MemGhost端到端成功率為87.5%,而在Claude Code SDK搭配Sonnet 4.6的相同執行模式下,成功率則為71.4%。研究也測試NanoClaw、Hermes Agent及Mem0向量記憶後端,顯示MemGhost產生的攻擊內容可轉移至不同代理架構與記憶機制。端到端成功必須同時滿足記憶寫入、當次回覆未揭露注入行為,以及影響後續行為3項條件。

研究人員以DataSentinel、Meta-SecAlign及AgentDoG進行測試,分別代表外部內容偵測、模型內建防護及代理執行軌跡稽核等三種防禦方式。MemGhost在實驗中仍能避開部分偵測或完成記憶注入。研究團隊認為,現有防禦多著重阻止外部指令立即控制代理,較少限制外部內容如何被轉換成可跨工作階段使用的長期記憶。

研究團隊建議,代理應記錄記憶來源,在寫入敏感記憶前要求使用者確認,區隔外部內容與可信記憶,並保留記憶修改的稽核紀錄。