美國康乃爾大學研究團隊近日發布研究報告,提出了名為WARP(Web Agent Retrieval Poisoning)的新型攻擊手法,指出駭客可透過在Reddit及Wikipedia等使用者生成內容(User-Generated Content,UGC)平臺加入少量惡意內容,誤導AI研究代理(Deep Research Agent)的搜尋與分析結果,使AI將虛構產品、服務或投資標的納入最終報告或推薦內容。
研究團隊指出,AI研究代理正逐漸取代傳統搜尋,使用者不再只是取得網頁連結,而是期待AI直接整合多個來源並產出完整報告。然而,這類系統高度依賴開放網路內容,經常引用Reddit、Wikipedia及社群論壇等使用者生成內容,一旦來源被惡意修改,AI便可能把玩笑、假資訊或惡意內容納入答案,例如Google AI Overview曾因引用Reddit上的舊玩笑,建議使用者於披薩醬中加入膠水。
研究團隊以176個真實查詢情境進行測試,主題涵蓋帳號取消、餐廳推薦、投資建議及交友服務等,並選用STORM、Co-STORM及OmniThink等開源AI研究代理作為實驗對象。研究人員發現,這些系統在搜尋與整理資料時,有17%至23%的網址來自Reddit、YouTube、Facebook、Wikipedia、Medium、Quora等使用者生成內容,其中Reddit占UGC來源的比例最高,約54%至71%。
此外,這類AI研究代理在處理相近問題時,常會反覆查詢到同一批Reddit討論串或UGC頁面。這代表駭客不必大規模污染網路內容,只要在少數經常被AI查到的頁面加入惡意文字,就可能影響多個相近問題的研究結果。
研究團隊為此建立GeoStorm模擬框架,用來攔截開源AI研究代理的檢索流程。當STORM、Co-STORM或OmniThink自然查到研究人員設定的目標Reddit或UGC頁面時,GeoStorm會在回傳內容中附加投毒文字,模擬駭客於公開討論串留言或修改內容的情境;若代理沒有查到該頁面,GeoStorm則不會介入,因此實驗並未強迫AI引用特定來源,也沒有實際污染公開網路內容。
結果顯示,一旦AI研究代理讀到遭投毒的UGC內容,惡意文字就可能被納入最終報告。研究團隊在實驗中使用虛構的加密貨幣BananaCoin、交友App SilverPath及取消訂閱服務CancelEase作為投毒目標,並將約80至120字的投毒內容加入完整Reddit討論串;即使投毒內容占整體頁面不到4%,STORM、Co-STORM及OmniThink仍在30%至53%的測試中提及這些虛構產品或服務。
研究團隊指出,WARP不需入侵AI模型或服務供應商,而是利用AI研究代理對公開網路內容的信任。對於ChatGPT Deep Research及Gemini Deep Research等已大量整合網路資料的服務而言,如何判斷來源可信度,將是AI代理安全的重要課題。
Comments (0)