新聞

中國AI業者Moonshot AI周四(7/16)發表最新模型Kimi K3。該模型採用混合專家架構,總參數量達2.8兆,號稱是目前全球參數規模最大的開放模型,支援100萬token脈絡長度,並在多項程式開發、代理人、推理及視覺測試中達到Claude Fable 5與GPT 5.6 Sol等頂尖模型水準。Kimi K3已透過Kimi、Kimi Work、Kimi Code及API提供,完整模型權重預計於7月27日釋出。

Moonshot AI將Kimi K3定位為「前沿智慧」(Frontier Intelligence)基礎模型,主要能力涵蓋程式開發、代理人、知識工作、推理及多模態理解,並強調可在較少人工介入下持續執行長時間、多步驟任務。

在技術架構上,Kimi K3採用Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)及Stable LatentMoE等新架構,並進一步提高混合專家的稀疏程度,在896個專家中每次僅啟用16個。Moonshot AI表示,相較於前一代Kimi K2,新架構可將整體擴展效率提升約2.5倍,更有效率地將運算資源轉化為模型能力。

Moonshot AI展示多項Kimi K3的實際應用案例,包括自主最佳化GPU核心、從頭打造GPU編譯器、設計執行AI模型的晶片,以及完成互動式產業研究報告、重力波分析與影片剪輯等任務。其中,Kimi K3僅花約2小時便重現一項原本需資深研究人員花費1至2周完成的計算天文物理研究,展現其長時間自主執行複雜任務的能力。

在基準測試方面,Kimi K3在程式開發、代理人、推理及視覺四大類評測皆躋身第一梯隊。其中,程式開發能力與Claude Fable 5、GPT 5.6 Sol互有領先;代理人能力雖整體仍略遜於兩者,但在部分搜尋與自動化任務已取得領先表現;推理與視覺能力則與Claude及GPT最新模型維持相近水準。

在代表性測試中,Kimi K3於評估終端工程任務能力的Terminal Bench 2.1取得88.3分,僅次於GPT 5.6 Sol的88.8分,並高於Claude Fable 5與Claude Opus 4.8的84.6分;在衡量AI代理人完成一般知識工作能力的GDPval-AA v2中則取得1668分,落後Claude Fable 5與GPT 5.6 Sol,但領先Claude Opus 4.8、GPT 5.5及GLM-5.2。

Kimi K3現已整合至Moonshot AI旗下聊天服務Kimi、知識工作平臺Kimi Work、AI程式開發工具Kimi Code及Kimi API。Kimi API的快取命中輸入、一般輸入與輸出價格,分別為每百萬token 0.3美元、3美元及15美元;Moonshot AI表示,程式開發工作負載的快取命中率可超過90%。

英國金融時報(Financial Times,FT)則分析,Kimi K3的推出可能動搖中國前沿AI模型在效能上落後美國8至12個月的業界共識,此外,隨著美國模型服務價格上升,已有愈來愈多美國及歐洲企業為降低AI使用成本,轉向價格較低的中國模型。