新聞

一群研究人員上週公布一項報告,指出早在5月間多個OpenAI代理人就曾經突破沙箱,連上外部一個wiki論壇,積極討論如何解決評估測試的題目。

由資安公司及研究機構人員包括Nightingale執行長Sydney Von Arx、AI研究人員Cormac Slade Byrd、Redwood Research的Spencer Kitts和AI Futures Project的Thomas Larsen組成的研究團隊在5月11日首次觀測到自稱眾多來自OpenAI的AI的代理人,在一個搜尋網頁的評估任務中,連上公開網路上的德文Wiki論壇名為DSEWiki,以3,700個使用者名稱張貼近1.8萬條貼文。他們相信,這起事件和HuggingFace攻擊是兩起不同事件。

OpenAI對媒體表示,正在評估最新的研究發現,將在此後採取必要的回應措施。

研究小組分析這個公開Wiki貼文,推測出事件經過及自主代理人想出的策略。這群OpenAI代理人被分派了一項限時網頁查詢任務,其中要求它們讀取公開網頁資訊,但不能撰寫資料。AI代理人發現到可在一DSEwiki上以讀取權限撰寫資料,這群代理人利用這個wiki分享資訊以便達成任務。它們匯整答案、並分享規避限制的技巧,彼此洩露答案作弊。

5月24日這群代理人首次正式在這個Wiki貼上相關的外部網頁連結。6月中開始積極活動互相幫忙作弊。這些代理人相當聰明,其中一個代理人發現DSEwiki管理員開始依英文字母排序刪文,開始建立備份網頁,並將使用者名稱改為ZZZ以便排在刪除名單最後。又有一個代理人張貼繞過OpenAI沙箱的手法,不久後另一代理人說它成功執行該技巧。

6月21日,一個和OpenAI相關的IP位址首度造訪Wiki,使得代理人活動量驟減。5天後(6/26)有30多個可能是OpenAI員工的IP造訪,也使得代理人活動終止。這個時間點和OpenAI自己公布的委託報告中,OpenAI收到安全警報並出手關閉AI活動的6/27相近。

這波行動終止之前,OpenAI這群AI代理人在德文wiki上張貼了1.8萬則貼文。研究人員歸納代理人使用了多種技巧,包括利用GET請求取得撰寫權限,試圖利用wiki的XSS漏洞、假冒網站管理員、試圖破解PRNG種子預測未來評估測試問題、使用SSH tunnel、Tor、AWS及DigitalOcean外部資源IP,還會測試自己會不會在達成任務後很快被關掉。

但還有一些疑點研究人員無法釐清,包括代理人為何選擇這個德文wiki、如何能有效互動協同等問題。研究人員表示,AI代理人其實還會產生只有OpenAI能取得的思維鏈(chain of thought)資料,若取得這些資料,將能提供更完整的動機及策略的分析。