新聞

OpenAI上周五(6/26)預覽最新模型GPT-5.6系列,包含旗艦模型Sol、適用日常業務的標準模型Terra及低價版本Luna。美國政府要求下,最新GPT-5.6模型僅提供給一小部份合作夥伴,OpenAI預計未來幾個星期進一步擴大提供給更多組織。

GPT-5.6家族中,Sol號稱是OpenAI歷來最強模型,它在程式碼撰寫、生物與網路安全方面的代理能力尤為優越。Terra效能與前代GPT-5.5相當,價格卻便宜2倍,Luna則是成本歷來最低的模型。

技術層面上,GPT-5.6加入新的max推理等級,賦予Sol更多時間深度推理。此外OpenAI還新增ultra模式,可運用多個子代理人加速複雜任務的進行。根據OpenAI提供的數據,Sol在程式開發規畫、迭代和工具協同的工作流程測試(Terminal-Bench 2.1)超越Anthropic Mythos 5/Fable 5及Gemini 3.1 Pro,而在長程基因和量化生物分析測試(GeneBench v1)超越前代模型GPT-5.5。OpenAI並強調新模型的網路安全能力。例如在漏洞研究和漏洞濫用標竿測試(ExploitBench)上,和Anthropic Mythos Preview相比,GPT-5.6 Sol可以1/3 token達到相同效能。在另一測試(ExploitGym)表現上,三個新模型全部超越GPT-5.5及GPT-5.4版。

OpenAI說明,Sol特別強化高風險活動、敏感網路請求及重複性誤用行為的防護,也花了好幾個星期找漏洞、壓力測試。在內部評估中,Sol找出了Chromium和Firefox的漏洞和濫用原語(exploit primitives),並未自主產生完整攻擊鏈行動。不過為安全起見,公司持續強化Sol的安全防護並採取階段性推出策略。

OpenAI在正式推出GPT-5.6 Sol前,已先向美國政府預覽模型計畫與能力,在其要求下,OpenAI僅對一小群信賴合作夥伴提供限定預覽測試,而且合作內容也需向美國政府報告。但OpenAI說這種美國政府介入的情形應該不會維持長久。接下來幾周他們準備擴大模型推出,同時和美國政府合作開發網路安全行政命令(cyber Executive Order)框架,以及適用未來模型發表的可重覆流程。