Kimi K3 公開 2.8T 權重都難放入屋:MoE 慳運算,冇幫你縮細模型
3C 產品

Kimi K3 公開 2.8T 權重都難放入屋:MoE 慳運算,冇幫你縮細模型

圖片:via XDA Developers — https://www.xda-developers.com/powerful-open-source-model-year-dropped-cant-run-home/
TechLab 編輯部(譯)·

完整權重約 1.56TB,官方部署建議用 64 張或以上加速卡

Moonshot AI 已經公開 Kimi K3 嘅完整權重、技術報告同相關程式碼。模型有 2.8 萬億個總參數、原生圖像理解同 100 萬 token context,規模確實誇張。不過 XDA 所講嘅「最強」同「前沿實驗室恐慌」都講得太盡:Moonshot 自己都承認整體表現仍然落後 Claude Fable 5 同 GPT-5.6 Sol,而美國政策人物針對中國公開權重模型嘅評論,亦唔係能力測試結果。

104B 啟用參數,唔代表只要放低 104B

K3 用 Mixture-of-Experts(MoE)架構,共有 896 個專家,每處理一個 token 會揀 16 個,再連同共享元件合共啟用約 104B 參數。好處係每一步唔使計晒 2.8T,運算量同耗電可以壓低;但下一個 token 可能揀中另一批專家,所以完整權重仍然要放喺系統隨時可讀嘅位置。104B 講緊每步做幾多運算,唔係下載大小或者最低 RAM 容量。

官方權重採用 MXFP4 專家權重同 MXFP8 activation,部分非專家元件保留較高精度。Hugging Face 嘅索引顯示,96 個 safetensors 檔案合共約 1.56TB。一隻 2TB SSD 勉強擺得落檔案,但推理仲要預留 runtime、工作 buffer、activation 同 context 狀態;Kimi Delta Attention 雖然慳到部分長 context 記憶體,冇消除權重本身。用 SSD 即時串流專家層或者再壓縮,技術上有機會開到模型,速度、精度同穩定性就同正常服務差好遠。

Kimi K3 官方主視覺,展示新模型嘅科技感圖像

圖片:Moonshot AI

官方口中嘅部署,已經係機房級數

Moonshot 嘅部署建議係用 64 張或以上加速卡組成嘅 supernode,重點仲包括卡同卡之間要有高頻寬連接。呢個要求未必代表少一張都啟動唔到,但清楚反映官方追求嘅吞吐量同延遲建基於企業級叢集。普通桌面機、單張顯示卡甚至幾張高階消費級 GPU,都唔屬於同一個玩法;就算砌到足夠系統 RAM,記憶體頻寬亦會令互動速度慢到失去實際用途。

公開權重同完整 open-source 仲有距離

K3 嘅權重、模型設定、推理程式碼同技術報告已經公開,授權亦容許修改、微調、部署同衍生作品,呢步進取過淨係開 API 好多。不過佢冇公開完整訓練資料,亦冇交代足以重現整個模型嘅製作流程。授權亦係 Moonshot 自訂版本。經營 Model-as-a-Service 嘅公司若連續 12 個月總收入超過 2,000 萬美元,要另行同 Moonshot 簽協議;超大型商業產品亦有顯示 Kimi K3 名稱嘅條件。叫佢做 open-weight 模型會準確啲。

API 每 token 平,agent 做完整工作未必平

一般開發者實際可用 Kimi 網頁、Kimi Code、Kimi Work 或官方 API。K3 API 公開價係每 100 萬 token:cache-hit input 0.30 美元、普通 input 3 美元、output 15 美元,未計適用稅項。呢個單價睇落有吸引力,但 coding agent 會反覆讀檔、改碼、跑工具同自我修正,總回合數同輸出量足以扭轉成本比較,唔可以淨係拎 input token 價牌判斷平貴。

Artificial Analysis 喺 7 月 21 日公布嘅獨立 AA-Briefcase 測試,K3 排名僅次於 Fable 5,不過平均每項工作要 83 個回合、約 12 萬個 output token,成本 10.57 美元,耗時 56.4 分鐘,當時每項工作成本仲高過 Opus 4.8。呢個結果幾有代表性:K3 能力已經去到前列,但 agent 做得迂迴,平 token 都可以變成貴工作。Moonshot 自己張 coding 表亦混合咗 Kimi Code、Claude Code、Codex 同內部測試,換一套 agent 框架,排名已經可能唔同。

公司用雲端版,要分清楚 API 同消費者服務

Kimi 官方 API FAQ 話,API 傳入同產生嘅資料唔會用作訓練,亦唔會為訓練而長期保存;但消費者版私隱政策就寫明,經加密同去識別處理後,輸入及輸出內容可用嚟改善模型,用戶要聯絡客服先可提出停止。兩種渠道條款唔同,試玩帳戶、正式 API 同企業合約唔應混埋處理。公開 FAQ 呢頁亦冇逐項列出所有營運記錄保存期、處理地點同分判商安排。

公司若打算畀 coding agent 讀私人 repository、客戶文件或者個人資料,採用前要向供應商確認資料處理地點、保存期限、刪除機制、分判商、事故通報同審計證明,再用合約鎖實;未確認之前,唔好直接貼入 production 密鑰、客戶資料同未公開程式碼。對冇企業 GPU 叢集嘅團隊,K3 最實際嘅試法仍然係 API 或託管服務,跟住用自家中文文件、程式庫同完整工作成本做一輪小規模評估。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook