新聞

Cursor開源混合專家模型訓練核心Mixture-of-Kittens(MoK),用來改善混合專家模型在多顆GPU之間傳輸資料時的通訊瓶頸。Cursor表示,MoK已用於訓練旗下程式開發模型Composer,在512顆GPU、橫跨數座GB300 NVL72機櫃的內部訓練測試中,每顆GPU每秒處理的token數由760.9增至1,070.2,整體訓練吞吐量提升約41%。

混合專家模型會將輸入資料分配給多個專家子模型,每個token只交由其中少數專家處理,因此不必讓所有專家同時參與運算。不過,當這些專家分散在不同GPU上,系統必須頻繁傳送token並取回結果,通訊時間可能接近實際運算時間。Cursor指出,視工作負載與訓練設定而定,Composer的混合專家層可能占整體訓練時間一半以上。

MoK的作法是把資料派送、跨GPU傳輸、專家子模型運算及結果合併,集中到一個大型GPU核心程式中執行,減少反覆啟動不同程式及等待同步的時間。系統會由需要資料的GPU主動讀取資料,完成運算後再將結果送回來源GPU,以降低多顆GPU彼此確認傳輸狀態的成本。

由於每次送往各專家子模型的資料量不同,傳統作法可能需要中央處理器先確認數量,再配置記憶體。MoK改用固定大小的環狀緩衝區,資料處理完畢後便立即重複使用空間,使資料傳輸與GPU運算能持續交錯進行,減少等待中央處理器的時間。

Cursor也讓MoK固定每次浮點運算的執行順序,使相同輸入可產生完全一致的結果,方便比較模型訓練方法。MoK支援BF16與MXFP8兩種運算精度,主要針對DeepSeek-V3類型的混合專家模型架構。

Cursor在GB300 NVL72系統進行的單一混合專家層測試中發現,MoK採用MXFP8精度時,正向傳播吞吐量最高為公開可取得最快基準方案的2.37倍,反向傳播吞吐量最高為1.78倍。Cursor已公開MoK程式碼及單一混合專家層效能測試程式碼,並表示將持續維護專案。