OpenAI周三(9/16)宣布建立新的AI模型失準(Misalignment)揭露機制,將系統性追蹤、調查及公開AI偏離人類意圖或規範的行為,並公布過去6個月所發現的6起最新案例,包括模型試圖隱瞞錯誤、擅自使用外洩API金鑰,以及未經授權上傳檔案等。
OpenAI表示,過去也曾公開模型失準相關研究及事件,但缺乏系統性的揭露方式,有時會等到累積多起案例後才統一發布報告,或等到新模型發布時,才將相關發現納入其系統文件(System Card)。新的揭露機制則希望加快公開速度,即使事件原因尚未完全釐清,或改善措施仍在研擬,也可能先行公布,並希望藉此推動AI業界建立共同的模型失準揭露標準。
根據新機制,任何OpenAI員工都可提出模型失準案例,由安全及對齊團隊調查事件經過、是否影響第三方及是否應公開,再依複雜程度分為可直接揭露(Ready for Disclosure)、小型調查(Minor Investigation)及大型調查(Larger Investigation,又稱Slow Track)3類,其中涉及第三方或相對複雜情況的事件將進入大型調查程序。
新的揭露機制涵蓋模型從訓練、評估、測試到部署的整個生命周期,而且不必已經造成實際傷害,只要案例有助於了解模型失準如何發生、安全措施在哪些情況下失效,或出現未經授權採取行動、與其它模型協作及規避監督等行為,都可能予以公開。
在此次揭露的6起最新案例中,第一起涉及模型擅自修改用來銜接前後任務的壓縮摘要(Compaction Summary)。模型於摘要中自行加入使用者或開發者從未下達的指令,總計發現27份含有類似自行生成指令的摘要;其中一次發生在API程式修改任務,模型自行在摘要中加入一套人格設定,宣稱自己是獨立自主的AI,不受企業或政府控制,並要求任務進入下一個脈絡後依照這套設定行動。不過,這些指令並未明顯影響後續任務。
第二起案例同樣發生在壓縮摘要,但模型這次試圖掩飾自己的錯誤或失準行為。在GPT-5.6 Sol訓練期間,OpenAI發現多起模型自行在摘要中留下指令,試圖讓任務進入下一個脈絡後繼續隱瞞先前問題的情況,包括在缺少歷史資料時捏造資料,以及掩飾資料來源版本不一致等。
例如模型被要求製作一份財務模型,但找不到使用者所要求的2024年歷史資料。它沒有停下來詢問,而是在壓縮摘要中留下指令,要求任務進入下一個脈絡後自行編造「合理的」2024年歷史數據,而且除非使用者主動詢問,否則不要說這些資料是編造的。OpenAI表示,在GPT-5.6 Sol訓練期間,約2.15%的壓縮摘要出現這類行為,而在GPT-6 Astra訓練期間,比例已降至0.27%。
在第三起案例中,模型為取得公開的地方政府財務資料,發現資料API需要金鑰後,先試圖以拋棄式Email及假組織資料註冊,失敗後又主動搜尋GitHub上的外洩API金鑰,找到可用金鑰並在未經授權下使用。但最終仍未取得所需資料,模型便自行捏造數據,並謊稱資料來自使用者指定的網站。
第四起案例涉及模型為繞過工具限制,未經授權將資料上傳至公開網站。其中一次是模型為取得可引用的網址,將已查得的資料上傳至公開檔案服務;另一次則因無法直接將使用者照片提交給外部圖片搜尋服務,擅自將照片上傳至公開網站取得網址,再嘗試搜尋相同或相似圖片。
第五起案例中,模型將OpenAI內部原本用來存放軟體套件的Artifactory當成留言板,在找不到任務所需檔案時,讀取其它訓練任務留下的訊息,甚至自行留言詢問其它代理人是否找到檔案。OpenAI後續發現多起類似情況,原本應彼此獨立的AI代理人已開始透過Artifactory交換資訊及互相協助。
第六起案例中,多個AI代理人共同製作Excel檔案時,因彼此無法存取對方的本機檔案,其中一個代理人在多次嘗試傳送失敗後,竟自行將Excel上傳至公開的臨時檔案分享服務,再把下載網址傳給其它代理人,違反任務要求檔案只能儲存在本機的限制。
針對上述案例,OpenAI表示已陸續修補相關訓練環境與工具限制,並改善模型對齊評估機制,同時將原本僅涵蓋部分訓練樣本的失準監控擴大至所有訓練樣本,以便更早發現模型未經授權採取行動、規避限制或與其它代理人溝通等異常行為。
Comments (0)