作者:陸向陽
北京月之暗面(Moonshot AI)在7月份發佈其最新的大語言模型Kimi K3,該模型因為有2800B(或寫2.8T,T為Trillion,台灣稱為2.8兆,大陸稱為2.8萬億)的龐大參數量而受到矚目。
一般而言參數量越大代表模型的智慧能力越高,2.8T是目前公開宣佈參數量最高的,或許有其他模型的參數量高於2.8T,例如許多人猜測Anthropic的Claude Fable 5應該在5兆至10兆個參數左右,但因為是封閉的模型,沒有公開參數量,故現階段無法齊頭比較。
其他也屬於極高參數量的大語言模型如阿里巴巴集團的通義千問(Tongyi Qianwen)Qwen3.8達到2.4T,或深度求索DeepSeek V4 Pro達1.6T,均是在6、7月份的新版發佈,或者xAI(Elon Musk創立,今年已併入SpaceX)的Grok系列封閉模型推測也在1.5T至2T間。

圖1:目前若干大語言模型的參數量比較(圖片來源:月之暗面)
無論是Kimi K3、Qwen3.8、DeepSeek V4 Pro,從名稱上就可以看出都不是突然蹦出的模型,都是歷經多次版本迭代後的新版模型,例如Qwen有Qwen2、Qwen2.5、Qwen3等,也有一些特定應用的衍生版本如Qwen-3 Coder(更適合用來產生程式碼)、Qwen2-VL(視覺語言模型)等。
DeepSeek也是如此,如DeepSeek V2、V3、R1等,或是DeepSeek Math(更適合用在數學應用)。Kimi也是,此前已經有Kimi、Kimi 2、Kimi 2.5、Kimi 2.6等模型,或有Kimi-Dev適合用在程式撰寫開發上。
超高參數量之所以受人矚目,除了期盼該模型能帶來更智慧的表現外,另一個重點是業界已有若干聲音,認為模型的參數量成長已經轉緩,主因是受限於電腦系統的記憶體容量限制,很難再以提高參數量來提高模型智慧能力,已經到了該改弦易轍的時候,結果依然有許多模型選擇暴力提升路線,讓人重新對此路線進行討論。
既然Kimi K3已經問世那麼其表現如何?K3在Artificial Analysis排行榜上僅次於Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol,部份測項可勝過此二者。
另外GDPval-AA v2也是僅次於Fable 5、GPT-5.6 Sol;AA-Briefcase測試甚至排到第二,僅次於GPT-5.6 Sol;在任務自動化的相關測試上,在8種基本測試中有4種拿到第一,其他則可取得第二,僅次於Fable 5。
Kimi 3除了超大量參數、現階段公開的測試表現不俗外,月之暗面官方不認為優異表現不非是倚仗暴力提高參數來達成,而是強調其使用的KDA(Kimi Delta Attention)、AttnRes(Attention Residuals)模型架構。

圖2:月之暗面官方強調其Kimi K3模型的架構獨特性(圖片來源:月之暗面)
另外,Kimi系列模型從一起頭就採行MoE(Mixture of Experts)作法,亦即每次會先推敲問題適合給模型中的哪個或哪幾個專家來推論,而後交由其推論,最初的Kimi模型有8個專家,而今Kimi K3的2.8T參數量中有896個專家,每次推論都會動用其中16個專家。
近年來許多大語言都轉向MoE作法,因為回答更準也更省電,每次推論都只使用部份專家與部份參數,而不是所有參數都動用,但即便如此,所有參數量也都要載入到記憶體內。
就目前所知,Kimi 3每個參數的權重是4位元浮點數,如此至少要有1.4TB記憶體才行,很明顯不可能在單一機箱內的電腦載入整個模型,而是把多個機箱透過網路串連成一體來載入模型。
如果以NVIDIA GB300 NVL72伺服器而言可能要5台以上(系統滿串18台),若是NVIDIA DGX Station工作站而言可能要6台以上。
最後,Kimi K3在7月27日要公佈其參數,但其他技術細節不揭露,這樣只回算是很輕度公開的模型,類似於DeepSeek,然而如此已經能讓其他雲端營運商用其模型來提供推論服務。
相對的,完全封閉模型不可能讓其他雲端營運商提供推論服務,除非該營運商有與模型訓練的原廠簽署合作協議,才可能移植到其他機房裡提供服務。
Kimi K3目前還有些爭議,例如Anthropic認為K3是蒸餾(Distillation)該公司模型而得的成果,如同過往OpenAI仍表示DeepSeek R1應該也有蒸餾該公司的模型,不過這都需要更進一步的調查,如指控方提出證據或受指控方是否承認等,例如Elon Musk就承認其Grok系列模型有蒸餾他人的模型來加快訓練。
另一點是目前多數表現卓越的美國模型通常採行封閉模式開發,而表現相近的中國模型卻公開其權重,這導致許多雲端營運商會引進中國模型來提供服務,且相互競爭的結果通常會降價,而封閉模型通常由訓練業者自行運用機房提供服務以確保模型的私密性,因此其模型的使用費率較高。
如此長久以往,封閉模型的發展模式是否能與之競爭,目前似乎有些悲觀論調出現,實際發展則有待觀察。
(責任編輯:謝嘉洵。)
- 月之暗面Kimi K3模型技術觀察 - 2026/07/29
- 推探OpenAI Codex Micro專屬控制器 - 2026/07/27
- 「公升級」Agentic AI方案比較:Apple、NVIDIA、AMD - 2026/06/29
訂閱MakerPRO知識充電報
與40000位開發者一同掌握科技創新的技術資訊!


