Kimi K3 再掀「Sputnik moment」:開放權重模型追到邊
Tech News

Kimi K3 再掀「Sputnik moment」:開放權重模型追到邊

圖片:via The Verge — https://www.theverge.com/ai-artificial-intelligence/968136/chinese-ai-models-another-sputnik-moment
TechLab 編輯部(譯)·

價錢平過美國旗艦,但 benchmark、自行部署同供應能力要分開睇

點解今次仲可以叫「意外」

Moonshot AI 推出 Kimi K3,聲稱呢個 2.8 萬億參數模型喺 coding、長時間 agent 任務同知識工作上,已經追到 OpenAI GPT-5.6 Sol、Anthropic Claude Fable 5 呢批旗艦。市場反應幾熟口面:科技股受壓、評論員再講 AI 軍備競賽,跟住「Sputnik moment」又出場。問題係,DeepSeek 喺 2025 年初已經演過一次;GLM、Qwen、Kimi 呢年幾亦一路追近。中國模型一路追近,其實已經唔算突然;市場今次反應咁大,反映唔少人仍然低估咗追趕速度。

Kimi K3 官方展示由模型製作嘅開放世界遊戲畫面

圖片:Moonshot AI

Benchmark 有料,但未去到全面贏

Moonshot 自己都寫得幾坦白:K3 整體表現仍落後 Claude Fable 5 同 GPT-5.6 Sol,實際使用體驗亦有明顯差距。佢公開嗰批 coding 數字就要再小心睇,因為部分模型用 Kimi Code,部分用 Claude Code 或者 Codex,推理力度、硬件同測試設定亦未完全一樣。agent 模型配邊套工具,本身已經足以左右成績,所以呢批屬於廠商自報 benchmark,證明 K3 有競爭力就夠,唔適合直接寫成性能排名。

獨立結果同樣幾亮眼。Artificial Analysis 畀 K3 嘅 Intelligence Index 分數係 57,發布後排第四;Arena 嘅真人盲選亦顯示,K3 喺前端 coding 排名去到第一梯隊。呢啲結果支持佢喺 coding 同 agent 工作真係追得好近,不過單一前端榜反映嘅主要係成品視覺同用家偏好,唔等於大型 codebase 維護、除錯、安全性同幾日不停運作都贏。K3 喺幾項測試贏到旗艦模型,但未足以證明整體能力已經可以取代佢哋。

平係真,但要揀啱比較對象

K3 官方 API 每 100 萬 input token 收 US$3,output 收 US$15;命中 cache 嘅 input 就係 US$0.30。對住 GPT-5.6 Sol 嘅 US$5/US$30,同 Claude Fable 5 嘅 US$10/US$50,K3 確實平好多,尤其 agent 長時間吐 code,output 價差會好快放大。不過 OpenAI 同時有 US$2.50/US$15 嘅 Terra,市場亦有一批更平嘅中國模型。咁睇,K3 賣點係用中階價錢買接近旗艦嘅能力,唔係成個 API 市場最低價。

價錢牌亦未包服務穩定性。K3 推出幾日後需求逼近容量上限,Moonshot 一度暫停新訂閱,優先照顧現有客戶。呢次容量問題亦反映,模型訓練完成後,廠商仲要花大量資源維持全球低延遲供應、尖峰容量、企業支援同 uptime。OpenAI 同 Anthropic 收得貴,當中亦包含佢哋經營咗一段時間嘅平台同企業服務;K3 要搶 production workload,呢方面要再跑一輪先知。

「開放權重」暫時仍係期票

截至 7 月 21 日,K3 只開咗 API,Moonshot 承諾最遲 7 月 27 日公開完整權重,所以而家叫佢 open-weight model,其實講緊一個就嚟兌現嘅承諾。相比之下,Z.ai 嘅 GLM-5.2 權重已經公開,仲用 MIT license,開發者而家就可以下載、改同部署。等 K3 權重、license、量化版本同推理工具真係齊全,再判斷佢開放到咩程度會穩陣好多。

就算順利公開,2.8 萬億參數亦唔代表普通公司擺幾張顯示卡就行得順。Moonshot 建議用至少 64 粒 accelerator 嘅 supernode 部署,呢個規模離一般初創嘅機房好遠。開放權重真正受惠嘅會先係大型雲端供應商、研究機構同有資料主權要求嘅企業;中小企多數仍會經 API 或第三方託管服務使用。可以自行部署係重要選項,不過硬件、推理優化同維護成本一樣走唔甩。

香港用 API 得,但敏感資料要自己把關

Kimi 官方文件寫明,海外可以經 api.moonshot.ai 使用 API,付款支援 Visa、Mastercard 等主要信用卡,暫時亦冇列出香港限制;不過官方冇提供香港專頁,實際開戶、信用卡風控同企業認證仍可能因賬戶而異。資料方面,Moonshot 話 API input 同 output 唔會用嚟訓練模型,傳輸亦有 TLS 加密,但公司若果要處理客戶個人資料、內部 code 或受監管文件,仍要先核對合約、資料儲存位置、保留政策同刪除流程,唔好淨係睇一句「不作訓練」。

K3 帶畀 OpenAI 同 Anthropic 嘅壓力已經幾實際:開發者多咗一個接近旗艦、價錢低一截、中文能力亦有吸引力嘅選擇。至於今次係咪另一個「Sputnik moment」,個比喻已經用到冇乜分析價值。下一步睇 7 月 27 日權重有冇如期公開、獨立 coding 測試能否重現成績,同 Moonshot 可唔可以撐住大規模 API 需求,會實際得多。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook