德國研究聯盟Soofi-Team本周公布開源Mamba–Transformer混合專家(mixture-of-experts,MoE)模型Soofi S 30B-A3B,為歐洲推動主權AI的最新專案。
SOOFI(Sovereign Open Source Foundation Models)是德國聯邦經濟和氣候保護部(BMWK)資助、在德國聯邦AI協會(KI Bundesverband)協調下,由歐洲知名的弗勞恩霍夫(Fraunhofer)研究所、DFKI等德國產學界多個機構組成的「Soofi-Team」開發的開源基礎大語言模型。它全程在德國電信慕尼黑營運的主權HPC AI基礎架構German Industrial AI Cloud上訓練開發。旨在提供一個在美國和中國模型之外由歐洲主導的開源模型給業界使用,主打強大推理和AI代理能力。
Soofi S採用Mamba–Transformer混合的混合專家(MoE)架構,類似Nvidia Nemotron,提供英文和德文版本。其混合設計下,每個token運算時僅啟動300億參數中的30億個,在脈絡增長時推論快取幾近保持不變(near-constant),這使它具備長文本的推論效率,在長脈絡、高併發(high-concurrency)環境下處理效能優於稠密模型。例如,Soofi S的每秒解碼token數(TPS)是傳統稠密模型(如14B到24B模型)的8到9倍,且在4K到256K的上下文長度下,吞吐量依然能保持平穩。
另一方面,Soofi S主打英、德語能力。Soofi S預訓練階段刻意為德文語料加權,以約27兆token進行訓練。開發團隊綜合英、德文的標竿測試中,Soofi S效能可比擬140億至270億參數的稠密模型(如Gemma 3 27B),而在混合英、德文的程式撰寫測試中,是17個開源模型(如EuroLLM、Apertus、Salamandra等)最佳,在英、德文中,Soofi S也取得全開源模型最高評分,超越Olmo 3 32B和Apertus 70B。甚至和知名模型如Nemotron 3 Nano (30B-A3B)及Mistral 3 14B、Qwen 3.5 (35B-A3B)及Gemma 3 27B相比,Soofi S在程式撰寫(英/德文)及數學(英/德文)項目拿下第一,而在MMLU、GPQA測試也拿下第二,僅落後Qwen 3.5。
Soofi S以高度寬鬆的授權開源,除了權重,訓練中間檢查點(Intermediate Checkpoints)、訓練與評測程式碼、超參數、特定過渡檢查點也都開源。此外,Soofi-Team也公開完整的預訓練語料庫統計數據與數據構建腳本,詳細列出各語言和數據源的比例,方便社群進行稽核與重現研究結果(reproduce)。
英文版Soofi-S可在Hugging Face上取得。
Comments (0)