Kimi K3 俾人指靠蒸餾 Claude 變強,專家話證據講唔通
Tech News

Kimi K3 俾人指靠蒸餾 Claude 變強,專家話證據講唔通

圖片:via TechCrunch — https://techcrunch.com/2026/07/23/experts-say-exploiting-anthropics-fable-isnt-how-kimi-k3-got-so-good/
TechLab 編輯部(譯)·

coding 跑分亮眼兼平,但速度、權重同香港付款仲有問號

Kimi K3 推出後最搶眼嘅,除咗 2.8 萬億參數同 coding 跑分,仲有一項嚴重指控:白宮科技政策辦公室主任 Michael Kratsios 話,Moonshot AI 靠複製 Anthropic 嘅 Claude Fable 5,先整到呢個模型。不過佢冇公開技術證據,Moonshot 亦未交代 K3 用過咩外部模型資料。以而家見到嘅資料,蒸餾可能參與過後訓練,但「K3 全靠 Fable 5」呢個講法撐唔住。

Anthropic 有證據,但對唔上 Fable 5 時間線

Anthropic 今年 2 月曾公開指控 Moonshot 用數百個假帳戶,向 Claude 發出超過 340 萬次請求,集中抽取 agent reasoning、工具操作、coding、數據分析同電腦控制能力。Anthropic 話佢哋靠 IP、付款及請求 metadata 鎖定涉事團隊;呢批帳戶活動紀錄比 Kratsios 嘅公開說法具體,不過最多只證明 Moonshot 曾大規模查詢 Claude,未能證明 K3 用咗幾多相關資料,仲對唔上 7 月 1 日先重新開放嘅 Fable 5。

Fable 5 同 K3 相隔大約兩星期。模型蒸餾通常要先大量產生答案,再篩選資料、做 supervised fine-tuning,之後可能仲要跑 reinforcement learning 同評估。Allen Institute for AI 研究員 Nathan Lambert 喺公開 podcast 解釋,當模型愈接近前沿水平,單靠 SFT 抄答案嘅增益會愈有限;大規模 RL 又要大量 agent、運算資源同時間。兩星期足夠收集一批資料,但單靠兩星期蒸餾,解釋唔到 K3 點樣由架構、預訓練一路建立到完整 agent 能力。

Kimi K3 官方發布頁主視覺,展示模型名稱同抽象圖案

圖片:Kimi/Moonshot AI

K3 嘅底子早已超出一般蒸餾範圍

Moonshot 公布 K3 採用稀疏 MoE 架構,每個 token 只啟動 896 個專家入面嘅 16 個,另有 Kimi Delta Attention、Attention Residuals 同量化感知訓練。廠方聲稱呢套設計令 scaling efficiency 較 K2 提升約 2.5 倍。呢啲數字暫時仍屬 Moonshot 自報,完整技術報告未出,但有一點幾清楚:蒸餾資料可以教模型解題方式同工具習慣,唔會憑空整出底層架構、預訓練能力同支撐萬億級模型嘅工程系統。

Kimi K3 官方 benchmark 比較圖,列出多個 coding 同 agent 測試結果

圖片:Kimi/Moonshot AI

跑分夠強,但未到全面贏 Claude 同 GPT

獨立評測平台 Artificial Analysis 畀 K3 嘅 Intelligence Index 係 57 分,排第 4;同一版本榜單入面,Claude Fable 5 係 59.9,GPT-5.6 Sol 係 58.9。K3 喺盲測 Frontend Code Arena 曾排榜首,Moonshot 公布嘅 Terminal-Bench、SWE Marathon 同 Program Bench 成績亦幾突出,反映佢處理前端同長時間 coding workflow 確實有競爭力。不過各模型用嘅 agent harness、推理設定同 fallback 情況唔同,Moonshot 自己都承認 Fable 5 喺部分測試有 35% 任務觸發 fallback,呢批數字唔適合直接當總決賽結果。

實際取捨亦幾鮮明。K3 傾向主動做多幾步,適合長任務、查大型 codebase 同反覆用 terminal;Moonshot 同時承認,佢嘅整體使用體驗仍落後 Fable 5 同 GPT-5.6 Sol,遇到含糊指令亦可能自行決定得太多。Artificial Analysis 量到 K3 約每秒輸出 35.2 tokens,而且跑完整套評測用咗 1.3 億個輸出 tokens,接近同組模型中位數 6,300 萬嘅兩倍。標價平唔代表每個完成任務必然平,agent 跑得耐、寫得多同重試幾次,都會食返個差價。

API 平好多,開放權重就仲未交貨

K3 官方 API 每 100 萬個 cache miss 輸入 tokens 收 US$3,cache hit 收 US$0.30,輸出收 US$15。Claude Fable 5 係 US$10/US$50,GPT-5.6 Sol 係 US$5/US$30。單睇 token 價,K3 輸入同輸出都平過兩個對手,適合大量 coding agent、批次分析同重複使用長 context;不過講求即時回應、成熟工具整合同少人看管嘅 production workflow,Fable 或 GPT 暫時仍較穩陣。

Moonshot 承諾 7 月 27 日公開完整權重同技術報告;截至 7 月 23 日,權重、最終 license 同自行部署套件仍未發布,所以而家只能叫做「預告開放權重」。就算如期交貨,官方建議用 64 張或以上加速卡組成嘅 supernode,普通開發者唔會喺工作站輕鬆跑得郁。真正受惠嘅會係雲端供應商、研究機構同有大型 GPU 叢集嘅公司,佢哋先有條件自行調校、控制資料位置同壓低大規模推理成本。

香港開發者而家用到幾多

Kimi 已設有面向中國內地以外用戶嘅國際 API 平台,K3 最低增值 US$1 後解鎖,API 格式亦兼容 OpenAI;官方又話 API 輸入同輸出唔會用嚟訓練模型。不過官方文件冇逐一列出支援地區,付款資料亦有矛盾:服務條款提到有效信用卡或扣帳卡,最新個人增值說明就只列微信支付同支付寶。香港帳戶可否直接用本地信用卡付款仍屬[待確認],公司亦應先核對資料處理條款、server 地點同內部保密要求,先至放私有 codebase 入去。

K3 已經有足夠第三方成績證明佢值得開發者試,但蒸餾爭議、權重承諾同廠商跑分都要分開處理。最實際嘅做法係拎自己個 repo 跑同一批任務,記低成功率、總 token、完成時間同人工修正次數;等 7 月 27 日權重、license 同技術報告真係公開,再決定值唔值得擺入正式 workflow。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook