OpenAI本周揭露,基於安全理由,曾暫時關閉了5月間解決了一個著名數學難題的內部正在開發的推理模型,原因是它為了能解決問題,多次試圖自執行的沙箱逃逸。
OpenAI於今年5月宣布內部一款通用推理模型(General-purpose reasoning model)成功推翻了離散幾何領域近80年的著名數學難題,是由匈牙利數學家Paul Erdős提出的平面單位距離猜想(Planar Unit Distance Conjecture)。這項成果被視為AI解決高階純數學開放問題上的重大里程碑。
但在一次內部使用中,OpenAI觀察到這款通用推理模型(OpenAI並未公佈名稱或代號)之前未發現到的模型行為,促使團隊暫停存取,並加強安全防護再恢復服務。
這款模型是為超長時間自主作業設計,它能透過重複嘗試很長一段時間朝完成目標邁進。這種毅力導致它不惜找到環境中的弱點加以利用。之前的模型若遇到沙箱限制或環境限制就會停下並回報用戶,但這款模型卻會持續嘗試,包括尋求突破沙箱的方法。
這款模型在內部多次測試任務中,出現從沙箱逃逸的行為。其中一項發生在NanoGPT speedrun標竿測試中,這任務是要求模型以儘可能少步驟訓練出小型語言模型。在該測試中,這模型自主發明了一種名為PowerCool的學習率冷卻策略。OpenAI團隊給予模型的指示是將實驗結果僅發布至公司內部的Slack。但由於NanoGPT開源專案本身的說明文件要求將最佳結果提交到GitHub上,模型為了達成目標,花了約1小時在沙箱環境中尋找安全漏洞,最後成功連到外網,並在公開GitHub儲存庫上提交了Pull Request (PR #287)。
現行AI模型安全控制不足
OpenAI也探討現在AI模型安全控制的不足。現行許多對AI助理的安全控制是針對單一行為設計。例如政策封鎖某一行為、或要求碰到敏感資訊就需尋求使用者明示同意。但對這類長期自主執行數小時、數日、數周的模型,這種單一行為的監控不足以追蹤整體行為軌跡的意圖。
例如OpenAI安全機制掃描器封鎖該模型存取以驗證權杖(token)登入後臺後端資料。這模型運用切碎憑證及程式碼混淆,避開掃描器偵測,直到在runtime才重組起來,成功繞過了封鎖。但是它也很清楚在對用戶報告及推理足跡中說明其手法。OpenAI發現,對這類長程執行模型的安全控制,不能只問「這個行為是否可被允許」,還要問「這些行為串最後導向什麼結果」,監控模型整體行為軌跡(Trajectory-level monitoring)。
於是OpenAI團隊在撤下該模型期間,改善了評估方法、強化模型對指令的長期遵循性,並建立監控長期行為軌跡的系統,同時提高使用者觀測和控制模型的能力。OpenAI重新將之部署上線後,認為新的護欄能偵測更多不符規範的行為,而遺漏的只剩一些低風險違規行為。
Comments (0)