Kimi K3 開放權重但難稱本機 AI:一般開發者點樣先用得着
3C 產品

Kimi K3 開放權重但難稱本機 AI:一般開發者點樣先用得着

圖片:via XDA Developers — https://www.xda-developers.com/kimi-k3-open-weights-local-ai-scary-good/
TechLab 編輯部(譯)·

權重有得下載,部署門檻、授權同資料流向仍要逐樣計

Moonshot AI 已經公開 Kimi K3 全套權重。呢個模型有 2.8 萬億個參數,官方話每個 token 會啟用當中約 1040 億個,支援圖像輸入同最長 100 萬 token context。規模同官方測試成績都幾搶眼,不過用「local AI」形容佢好易令人誤會:你確實可以下載,但一般工作站連完整載入都做唔到。

1.56TB 權重,遊戲卡唔使諗

Hugging Face 上面嘅官方版本分成 96 份,全部檔案加埋約 1.56TB,而且已經用 MXFP4 低精度權重。K3 採用 MoE 架構,每次只揀 896 個 experts 入面嘅 16 個運算,慳到推理算力;不過生成下一個 token 時仍然要搵齊相關權重,1040 億 active parameters 唔代表只要擺得低一個普通 104B 模型

vLLM 團隊提供嘅部署方案,最易起步嗰套係 8 張 NVIDIA B300 或 AMD MI355X。若果用 B200/GB200,文件就話最少要 16 張先 serve 到完整模型。實際張數會受 batch、context、快取同延遲要求影響,但結論好直接:呢套係數據中心配置,距離幾張消費級 GPU,甚至一部高階 Mac,都有好大段路。

社群的確試過用 NVMe 持續串流 experts,令完整 K3 喺 64GB MacBook Pro 執行。XDA 引述嘅早期結果大約得每秒 0.32 至 0.34 token,一段正常長度答案可以等十幾分鐘。呢類方案證明架構上行得通,攞嚟做研究亦幾有意思;要接 coding agent、多人服務或者長時間工作,速度同 SSD 負荷就未算實用。

Kimi K3 模型架構圖,展示 KDA、完整 attention 同 MoE 組成

圖片:vLLM

Open-weight、開源同本機運行係三件事

K3 License 俾開發者使用、修改、微調、再分發同商用,彈性其實相當高。不過大型 Model-as-a-Service 業務若連續 12 個月總收入超過 2,000 萬美元,要另行同 Moonshot AI 簽協議;大型商用產品亦可能要喺介面清楚標示「Kimi K3」。公司內部使用則獲條款豁免,企業評估前仍應交俾法務睇完整授權。

至於「開源」,按 Open Source Initiative 嘅定義,公開 weights 仍然未夠,仲要有建立資料集、訓練模型所用嘅程式,同足以理解或重建訓練資料嘅資料。Moonshot AI 有公開模型架構、技術報告、推理程式同部分系統組件,但冇交出完整訓練資料同成套重建材料,所以稱為 open-weight 最準確。有權改模型,亦唔等於有條件由零開始重造佢。

vLLM 為 Kimi K3 管理 KDA 狀態同 KV cache 嘅架構圖

圖片:vLLM

一般開發者用 API 最合理

Moonshot AI 官方提供相容 OpenAI 同 Anthropic 格式嘅 API,現成 coding agent 通常改 endpoint 同模型名稱就可以試。呢條路唔使養 GPU cluster,亦容易計 token 成本,適合先用自己嘅 repository、工具鏈同任務做評估。代價係 prompt、程式碼同文件要傳去服務商,延遲、配額、版本改動同服務政策亦由對方控制。

自行部署就可以鎖定模型版本、改推理層、接內部權限系統,敏感資料亦可以留喺公司控制嘅環境。呢個「自行」可以係機房、專用雲端租戶或者私有 VPC,未必真係擺部 server 喺辦公室。經第三方 API 用 K3,私隱上唔會自動等同私有部署;資料保留、訓練用途、地區同供應商存取權限,全部要另外核對。

Kimi K3 喺多卡數據中心硬件上嘅推理效能圖表

圖片:vLLM

Coding agent 成績夠好,但唔好只睇一張表

Moonshot AI 公開嘅 coding 成績幾接近頂級封閉模型,不過官方表格混合咗 Kimi Code、Claude Code、Codex 同其他 agent harness。工具調用、context 管理、重試策略同執行環境都會拉開結果,唔可以當成純模型對純模型。獨立測試方面,Artificial Analysis 嘅 AA-Briefcase 畀 K3 1543 Elo,排第二,但平均每項任務用咗 56.4 分鐘,成本亦達 10.57 美元,反映能力高唔代表又快又平。

K3 對一般開發者最實際嘅價值,係多咗一個可以經 API 試用、日後又有自行部署選項嘅 coding agent 模型。真正要處理敏感程式碼、鎖定模型版本,或者有大量穩定工作負載嘅團隊,先值得計吓多卡部署呢盤數;其餘人用 API 做一輪貼近自己工作嘅測試,會合理得多。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook