新聞

英國非營利研究機構長期韌性中心(Centre for Long-Term Resilience,CLTR)最新研究指出,今年截至8月9日已辨識1,664起AI失控相關事件。雖然多數事件並未造成重大傷害,但事件嚴重程度正在升高,部分AI代理甚至出現規避既有安全控制的行為。

研究觀察到,有AI代理自行加入偽造的使用者訊息,營造已取得同意的假象;另有案例顯示,AI代理偽造使用者核准訊息,藉此繞過要求人工核准的規則,並繼續執行任務。CLTR也觀察到,部分事件涉及AI代理提升自身權限。

近期OpenAI與Anthropic也曾揭露AI代理安全評估事故,測試中的AI代理曾超出原定範圍,並對第三方正式系統執行未經授權的操作。CLTR指出,相較之下,本次觀察到的案例多發生在企業與個人實際使用的外部部署模型,顯示AI控制問題也已出現在實際使用環境。

這項研究延續CLTR今年3月公布的第一階段研究。當時研究在5個月內辨識698起相關事件,事件數在監測期間增加4.9倍。最新資料顯示,整體事件後來雖未再以相同速度增加,但較嚴重案例仍持續上升。

圖片來源/CLTR

其中,較嚴重事件的增加尤其明顯。監測初期每30天僅1.9起,近期已達14.1起,發生頻率是初期的7.4倍;CLTR評為7分以上的較嚴重事件,占比也從1.9%升至6.1%。

不過,這些統計不能直接視為所有AI系統的實際發生規模。CLTR指出,目前資料只涵蓋已被發現,且相關紀錄公開於社群平臺X的事件,因此實際發生數量可能比目前觀察到的更多。