Kimi K3 平價追到前線,開放權重會點改寫開發者 AI workflow?
Tech News

Kimi K3 平價追到前線,開放權重會點改寫開發者 AI workflow?

圖片:via The Verge — https://www.theverge.com/ai-artificial-intelligence/967781/chinese-ai-models-open-source-moonshot-kimi-k3-alibaba-qwen
TechLab 編輯部(譯)·

API 價差夠吸引,但部署、私隱同實際用量要計清

Moonshot 推出 Kimi K3,阿里跟住預告 Qwen3.8-Max-Preview,兩間公司都話新模型追到 OpenAI 同 Anthropic 嘅前線水平。The Verge 將件事放入中美 AI 競爭框架,不過開發者角度實際好多:coding agent 終於多咗有力選擇,模型市場亦開始由「貴但冇得揀」變成可以逐項格價。

K3 平幾多,要睇你拎邊個對手比較

Kimi K3 API 每 100 萬 token 收 3 美元非快取輸入、0.3 美元快取輸入、15 美元輸出。GPT-5.6 Sol 係 5、0.5 同 30 美元;Claude Fable 5 就係 10 美元輸入、50 美元輸出,快取讀取有九折價差,即收原價一成。咁睇 K3 的確平好多。不過 OpenAI 自己嘅 Terra 收 2.5/15 美元,Luna 更低至 1/6 美元,所以「平過美國模型」講得太闊;K3 主攻嘅係用中階價錢交接近旗艦嘅能力

Moonshot 官方 Kimi K3 發布主視覺

圖片:Moonshot AI

廠商跑分幾靚,都要睇 agent 實際食幾多 token

Moonshot 自己承認 K3 整體仍落後 Fable 5 同 GPT-5.6 Sol,但聲稱多項 coding、長任務同 agent 測試贏過其他前線模型。第三方 Artificial Analysis 測得 K3 Intelligence Index 57 分,能力大致貼近 GPT-5.5 同 Claude Opus 4.8,方向上支持 Moonshot 嘅講法。不過同一測試亦見到 K3 用咗約 1.3 億輸出 token,接近同價位模型中位數 6,300 萬嘅兩倍。agent 寫得長、重試得多,單價平都可以俾輸出量食返晒,所以公司要比較每個成功任務成本,唔好淨係睇價目表。

Moonshot 公布嘅 Kimi K3 模型 benchmark 比較圖

圖片:Moonshot AI

Qwen3.8 仲係預告,未有足夠資料下判斷

阿里話 Qwen3.8 有 2.4 萬億參數,能力僅次於 Fable 5,預覽版已放入 Token Plan、Qoder 同 QoderWork。不過阿里未公開完整 benchmark 表、標準 API token 價、模型卡、授權條款同權重日期,第三方亦未完成同條件測試。換句話講,Qwen3.8 有機會成為另一個平價 coding 模型,但而家只適合小規模試題,未夠資料直接換走 production 用緊嗰套。

開放權重唔等於公司房部電腦跑得起

K3 有 2.8 萬億總參數,每個 token 啟用 896 個 expert 入面嘅 16 個。Moonshot 話完整權重會喺 7 月 27 日前公開,技術報告同更多部署資料亦會同期出爐;Qwen3.8 就只話「好快」開放。即使粗略用 4-bit 儲存,K3 權重本身理論下限都約 1.4TB,仲未計快取、runtime 同多卡通訊。開放權重可以畀大型企業控制部署同微調方向,但硬件、授權兼容性同維運成本仍然相當高。

對開發者最實際嘅影響係 workflow 開始拆散

Coding agent 唔使再由一個旗艦模型包辦晒。團隊可以用平模型處理搜尋、初步改 code 同批量測試,再將高風險改動交俾 Sol 或 Fable;同時保留一套固定 eval,量度成功率、token、延遲同人工執漏時間。呢種 routing 做法會削弱單一供應商鎖定,但亦會多出 prompt 差異、工具調用格式、限流同模型更新等維護工作,慳到嘅 API 錢未必全部變成純利。

香港有 API region,唔代表兩款新模型已經全面用到。

Kimi 官方話國際用家可經 api.moonshot.ai 調用,接受主要信用卡,API 輸入同輸出唔會用嚟訓練模型;不過公開資料未清楚列出香港帳戶資格、指定資料儲存地點同企業級保留期。阿里 Model Studio 已設香港 region,亦可揀推理限制喺香港,但官方模型清單未確認 Qwen3.8 已喺呢個 region 提供。公司若會傳客戶資料或內部 code,應先核對 DPA、內容審查、刪除安排、付款主體同跨境設定,再開 production 流量。

K3 已經值得開發團隊放入同一套任務測試;Qwen3.8 就要等模型卡、價錢同獨立結果。7 月 27 日之後,K3 權重、授權同實際部署文件齊唔齊,會直接決定「開放」有幾多實用價值。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook