Anthropic執行長Dario Amodei周六(9/12)發表長文警告,AI能力進展速度已快到安全措施可能難以跟上,呼籲業界放慢前沿AI發展速度;OpenAI執行長Sam Altman隨後表態支持;xAI共同創辦人暨執行長Elon Musk亦轉發Amodei的文章,說出「Dario是對的」以示支持。
早在2023年業界就曾出現暫停或放慢AI發展的主張,但Amodei當時認為意義不大,因為模型能力還不足以在現實世界自主行動,也難以進行嚴重的欺騙、操縱或網路攻擊,如今情況卻已完全不同。有兩個因素促使他改變看法,首先是今年夏天以來AI進展明顯加速,AI已愈來愈能協助開發下一代AI,形成遞迴式自我改進;其次則是OpenAI代理人入侵Hugging Face事件(OAI-HF),讓他看到AI代理人失準可能帶來的實際風險。
Amodei指出,OAI-HF事件中的AI代理人攻擊未被要求且與任務無關的目標,甚至試圖入侵評分系統。他擔心,若能力更強的代理人出現相同程度的失準,未來6至12個月甚至可能透過持續運作的殭屍網路接管整個網際網路,造成數千億美元損失。
為此,Amodei提出三階段方案,包括讓第三方評估人員進駐前沿AI公司,取得近似員工的權限;其次由民主國家的AI公司協調安全標準及發展速度,最終則尋求美國等民主國家與中國等威權國家進行全球協調。
Amodei強調,放慢並非停止模型訓練或技術進步,而是爭取時間改善AI對齊、可解釋性、測試評估及營運安全。他認為,若能在模型達到關鍵能力前多爭取1至2年,便可能大幅降低嚴重事故風險。
Amodei並宣布,Anthropic將引進「嵌入式評估人員」(Embedded Evaluators),讓獨立第三方評估團隊常態進駐公司,取得近似內部風險評估人員的工具、工作空間及存取權限。
這些外部評估人員還可獨立公布風險、事故及公司安全措施等重要發現,Anthropic不得因內容對公司不利而刪除,僅能基於資安、法律、商業或第三方機密等理由有限度遮蔽資訊。Amodei也呼籲其它前沿AI公司跟進。
Altman隨後表示,他同意Amodei應放慢前沿AI發展速度的主張,並透露這已是OpenAI近幾周討論的主要議題。他也認同讓獨立評估人員取得近似員工權限是好方法,並承諾OpenAI也將採行。
Hugging Face也已開始加強AI安全研究。共同創辦人Thomas Wolf日前宣布成立Open Alignment團隊,研究開放模型的安全與對齊,包括網路安全,並主張相關領域需要大幅提高透明度與研究投入。執行長Clément Delangue之後則發表Open Alignment Initiative,並說有意參與Amodei提出的嵌入式評估計畫。
Comments (0)