新聞

DeepSeek周四(9/10)發表新一代AI模型V4.1-Flash,採用全新的Causal Encoder-Decoder(CED)架構,為DeepSeek新架構家族中的首款也是最小型模型。DeepSeek宣稱,V4.1-Flash不僅推論速度及吞吐量更高,在多項基準測試的整體表現也超越上一代旗艦V4-Pro。

V4.1-Flash是一款總計5,520億參數的混合專家(MoE)模型,最大支援100萬token脈絡,並原生支援文字及圖片輸入。新模型最大的改變,是將40層Transformer分成20層因果編碼器及20層解碼器,分別負責處理輸入及產生輸出。

這種非對稱設計讓V4.1-Flash處理輸入時,每個token僅需啟用80億參數,產生輸出時則啟用160億參數。相較之下,上一代V4-Flash共有2,840億參數,每個token啟用130億參數;也就是V4.1-Flash雖然總參數接近翻倍,處理大量輸入內容所需啟用的參數反而更少,特別適合需要反覆讀取文件、程式碼及工具回傳結果的AI代理工作負載。DeepSeek也進一步壓縮V4.1-Flash的KV cache(模型生成內容時,用來暫存先前token運算結果的快取),相較上一代,所需HBM容量降至1/4,SSD儲存空間則降至1/8。

在效能上,V4.1-Flash採用新的預訓練方法及更大規模的強化學習後訓練,在程式開發、數學及代理人等多項測試中已超越V4-Pro。DeepSeek表示,多方測試顯示V4.1-Flash在效能、成本、速度及完成任務總時間均優於V4-Pro,因此將逐步淘汰V4-Pro。

V4.1-Flash目前已在DeepSeek API上線,並於Hugging Face釋出模型權重,每100萬輸入及輸出token的API尖峰價格分別為0.3及1.2美元,離峰價格減半。原有V4-Flash及V4-Flash-Vision-Exp已退役;9月14日起,V4-Pro也將由V4.1-Flash暫時取代,直到V4.1-Pro推出。