
Inkling 開放權重兼食盡三種輸入,975B 模型實際有幾開放?
Thinking Machines 首款模型主打微調、長 context 同 coding agent
975B 睇落誇張,運算時用嘅係 41B
Mira Murati 創辦嘅 Thinking Machines 推出首款基礎模型 Inkling,規格最搶眼嗰行係 975B 總參數、每個 token 啟用 41B。佢用 Mixture-of-Experts 架構,每次只揀部分專家網絡工作,唔使每生成一個 token 都郁晒成個模型。咁做可以壓低運算量,不過唔代表其餘權重可以唔載入;儲存模型同擺佢入 GPU RAM,仍然係兩回事。
Inkling 原生接收文字、圖片同聲音,再輸出文字,完整權重版本支援最多 100 萬 token context。官方話模型用 45 萬億個文字、圖片、聲音同影片 token 預訓練,之後再針對 coding agent、工具調用同長流程任務做 post-training。呢組合幾適合文件分析、語音資料整理,或者要睇住介面同程式碼做事嘅 agent,而唔只係普通聊天機械人。

圖片:Thinking Machines Lab
開放權重,唔等於完整開源
Inkling 權重放咗上 Hugging Face,標示採用 Apache 2.0 授權,開發者可以下載、修改同整合落產品。呢個自由度確實高過只供 API 嘅封閉模型。不過官方模型卡只概括話訓練資料來自公開來源、第三方資料同合成資料,冇公開可重建整套訓練資料嘅清單;完整訓練程式、資料處理細節同訓練基建亦唔係全部齊備。
所以較準確嘅講法係「開放權重」,唔好直接當佢係由資料到訓練流程都完全透明嘅開源項目。TechNews 科技新報報道將 Inkling 放入中美開放模型競爭脈絡,呢個角度有市場背景,但 Thinking Machines 自己主打嘅其實係可微調、多模態同部署彈性,官方甚至直認 Inkling 唔係整體能力最強嘅模型。
一般電腦下載到,亦未必跑得郁
「權重有得下載」最易令人誤會成 Mac、電競 PC 都可以本機開箱即用。Hugging Face 指完整 BF16 checkpoint 大約要 2TB VRAM,NVFP4 版本都要約 600GB VRAM,實際上已經係多張數據中心 GPU 或多機部署嘅級數。就算再壓成極低 bit 數版本,速度、context 長度、準確度同多模態能力都可能要讓步,唔可以當成同原版完全一樣。
41B active 主要影響每個 token 嘅計算成本,975B 總權重就繼續影響載入模型要幾多記憶體。呢個分別好關鍵:MoE 可以令大型模型推理效率合理啲,但冇將近一萬億參數變走。真係想試嘅開發團隊,用託管 API 或租 GPU 叢集,通常實際過自行買硬件。
對開發者有用嘅位係微調同 agent workflow
Thinking Machines 將 Inkling 接入自家 Tinker 平台,提供 64K 同 256K context 微調,亦整咗 Playground 畀開發者先試模型。官方公布嘅 API 夥伴包括 Together、Fireworks、Modal、Databricks 同 Baseten;Fireworks 頁面顯示 Inkling可作 on-demand 部署,但暫時唔支援 serverless 同平台內微調。供應方式、免費試用期同價錢都可能會改,正式開展項目前要逐間核對清楚。
Inkling 對 coding agent 嘅價值,係模型可以讀長篇程式碼、調用工具,亦可以按團隊內部規則再微調。假如公司要處理私有文件、客服錄音、產品截圖同 codebase,單一多模態底模會少咗幾層資料轉接。不過用第三方 API 仍然要睇資料保存、地區處理同保密條款;自行部署控制力高啲,代價就係 GPU、維運同推理優化成本。
跑分顯示有競爭力,但未到全面領先
官方發布咗知識、數理、coding agent、圖像同聲音測試,不過呢批結果由廠方自行揀設定同執行,應該當產品資料睇。獨立評測機構 Artificial Analysis 將 Inkling 列入 Intelligence Index,得分 41,排喺美國開放權重模型前列;佢喺部分 agent 任務贏 Kimi K2.6 同 DeepSeek V4 Flash,平均輸出 token 亦少過幾款主要開放權重對手。
同一份第三方結果亦顯示,Inkling 冇全面壓過頂級封閉模型或所有中國開放權重模型,而且幻覺率仍然值得審慎處理。現階段較合理嘅判斷係:佢係一個多模態、可微調、agent 表現幾突出嘅大型底模。開發團隊可以先用真實 codebase、粵語資料同內部文件做小規模評估,再決定微調或長期部署值唔值個成本。
參考來源
- TechNews 科技新報 — Thinking Machines 首款開放權重模型發表,制衡中國模型擴張 — original report
- Thinking Machines:Introducing Inkling — 官方公告,交代架構、訓練、Tinker 微調同 API 部署選項。
- Inkling 官方模型卡 — 核對 Apache 2.0 授權、輸入格式、模型限制、安全建議同權重資料。
- Hugging Face:Welcome Inkling — 核對 BF16、NVFP4 所需 VRAM、推理框架支援同本機量化限制。
- Artificial Analysis:Inkling 獨立評測 — 交叉核對模型能力、agent 任務表現、token 用量同幻覺率。
- Fireworks AI:Inkling 模型頁 — 核對 on-demand 部署、context 長度同平台暫時支援嘅功能。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







