OpenAI公布首款自研推論晶片Jalapeño的首批效能測試結果,在GPT-OSS 120B、DeepSeek R1 670B與Kimi K2.5 1T三款大型語言模型上,Jalapeño峰值每瓦吞吐量為比較系統的1.5至1.9倍,端到端回應延遲則減少約43%至72%。OpenAI預計2026年底開始將Jalapeño部署到自家運算基礎架構。
OpenAI解釋Jalapeño的設計重點,是減少大型語言模型推論過程中的資料搬移與晶片間通訊。模型在接收問題時,需要先處理整段輸入內容,之後再逐一產生回應詞元,兩個階段對運算與記憶體的需求不同。OpenAI讓生成回應時需要反覆使用的KV快取等資料盡量留在本地,降低不同運算單元之間搬移資料造成的等待時間。
OpenAI採用SemiAnalysis公開的InferenceX基準測試,比較從系統接收使用者請求到完成回應的完整推論流程。測試中,GPT-OSS 120B以Nvidia GB200作為比較對象,DeepSeek R1與Kimi K2.5則以較新的GB300比較。
Jalapeño執行GPT-OSS 120B時,峰值每瓦吞吐量約為GB200的1.9倍。執行DeepSeek R1時約為GB300的1.7倍,完整請求的回應時間從5.99秒降至1.65秒。Kimi K2.5的峰值每瓦吞吐量約為GB300的1.5倍,回應時間則從5.31秒降至1.56秒。
OpenAI也利用AI協助Jalapeño的程式最佳化,開發團隊透過Codex搭配GPT-Astra,在兩個月內把3款原先未列入Jalapeño生產規畫的開放權重模型最佳化到高效能水準。其中GPT-OSS部分注意力機制與混合專家模型運算區塊,由AI產生的實作速度較既有人類專家版本快1.5至1.8倍。
OpenAI預計今年底開始部署第一代Jalapeño,第二代已進入深入開發階段,第三代也已開始規畫。該公司同時也表示,未來仍會持續使用Nvidia及其他合作夥伴的加速器,支援AI模型訓練與推論。
Comments (0)