Kimi K3 開放權重:2.8T 模型放入 coding workflow,邊個真係用得着?
Tech News

Kimi K3 開放權重:2.8T 模型放入 coding workflow,邊個真係用得着?

圖片:via TechNews 科技新報 — https://technews.tw/2026/07/28/moonshot-ai-releases-the-model-weights-and-technical-report-of-kimi-k3/
TechLab 編輯部(譯)·

API 接入唔難,自行部署、成本同資料去向都要計清楚

TechNews 科技新報報道,Moonshot AI 已經喺 7 月 27 日公開 Kimi K3 權重,完整下載量約 1.56TB。公開權重之後,開發團隊除咗可以下載模型,亦可以按需要揀官方 API、第三方雲端或者自行部署,成套 coding workflow 唔使長期綁死喺 Claude 或 GPT。不過由「有權重」去到「公司用得順」,中間仲有硬件、agent 效率、授權同資料安排幾道關。

2.8T 聽落誇張,104B 啟用參數先解釋到點運作

Kimi 官方資料顯示,K3 係 Mixture-of-Experts 模型,總共有 2.8T 參數,但每個 token 只會揀 896 個專家入面嘅 16 個,加埋共享專家,每次實際啟用約 104B 參數。咁做可以減低每次推理嘅運算量,配合 MXFP4 權重、MXFP8 activation 同 Kimi Delta Attention,亦有助控制長 context 成本。不過全部權重依然要放得落硬件,104B 絕對唔代表一張消費級 GPU 就跑得郁完整模型。

K3 支援最多 1,048,576 token context,對大型 codebase、長時間 agent session 同大量工具輸出幾吸引。不過 1M 只係容量上限,塞滿晒 repo、log 同歷史對話,延遲、cache 同推理成本照樣會升。官方自己喺部分 agent 測試都會喺 300K token 觸發 context compaction,反映長窗口始終要配合整理策略,唔係將成個 repository 一次過倒入去就自然寫得準。

Kimi K3 官方展示嘅開放世界遊戲開發案例,角色騎馬行近林中營地

圖片:Moonshot AI / Kimi

接 API 容易,搬 agent loop 仲有細節

Moonshot 提供 OpenAI-compatible 同 Anthropic-compatible API,現有工具改 base URL、API key 同 model name,起步成本算低。K3 亦支援 tool calling、structured output 同自動 context cache,方向上啱晒 coding agent。不過佢長開 thinking mode,多輪對話要將 API 回傳嘅 reasoning_contenttool_calls 同其他 assistant message 原樣傳返下一輪。漏咗呢部分,agent 可能接唔返之前嘅思路,所以 compatible 只代表介面相近,未保證每套 Claude Code 或 Codex workflow 可以無痛換模型

Token 價平,成項工作未必平

K3 API 標價係每百萬 uncached input token 3 美元、cache hit 0.30 美元,output 就係 15 美元。單睇輸入價的確幾進取,重複讀同一批 code 時,九成 cache 折扣亦幫到手。不過 coding agent 會反覆思考、讀檔、跑工具同改錯,總成本取決於佢要用幾多輪先交到合格結果。比較 Claude 或 GPT/Codex 時,應該計每個完成任務嘅價錢、時間同成功率,淨係拎每百萬 token 價目表會睇少咗一大截。

Artificial Analysis 嘅獨立 AA-Briefcase 測試就見到呢個問題:K3 排名只落後 Claude Fable 5,但每項任務平均花 10.57 美元、83 輪同約 56.4 分鐘,成本高過 Claude Opus 4.8。呢套係知識工作測試,唔可以直接當 coding 結論,不過呢個結果至少提醒大家,低 token 單價未必等於低 workflow 成本。至於 Moonshot 公布嘅 coding 成績,部分模型分別用 Kimi Code、Claude Code、Codex 或其他 harness,測試硬件同 fallback 情況亦有差異,暫時適合當試用線索,未適合當勝負表。

自行部署係數據中心級工程

一般開發者下載 1.56TB 權重返屋企冇乜實際意思。vLLM 官方部署 recipe列出最低 8 張 GB300,正式流量建議用多節點;SGLang 嘅參考配置就包括 16 張 H200 或 32 張 H100。呢啲仲未計機房網絡、散熱、KV cache、同時處理量同維護人手。對 startup 或中小企嚟講,經官方 API 或雲端供應商試用合理得多;自行部署較適合已經有 GPU cluster、又有資料隔離或模型微調要求嘅團隊。

開放權重有空間,但授權同資料安排要先睇

K3 用自訂授權,容許使用、修改、微調、分發同出售衍生版本,但條款唔等同毫無門檻。按完整 Kimi K3 License,經營 Model-as-a-Service、連續 12 個月總收入超過 2,000 萬美元嘅公司,要另行同 Moonshot 簽協議;超大型產品亦可能要喺介面展示 Kimi K3 名稱。內部使用同經官方或認證供應商接入有豁免。訓練資料同完整訓練方法冇公開,所以稱為開放權重會準確過完整開源。

企業經 API 傳 code 前亦要分清楚產品版本。Kimi 官方話 API input 同 output 唔會用嚟訓練模型。官方公開文件暫時冇清楚列出香港 API 付款支援、API request log 保存日數同實際數據位置,正式採用前要向供應商攞 DPA、確認處理地區同刪除安排。K3 而家最啱用嚟跑一批自家 repository 任務,再同現有 Claude Code 或 Codex 帳單、完成時間同 review 成本逐項對數。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook