
中國 AI 晶片規格追近仍難換走輝達,卡位喺軟件兼容同叢集穩定
企業搬模型要改程式、鎖版本,推理服務仲要頂得住長時間運行
TechNews 科技新報報道,中國 AI 公司面對推理需求急升,會將部分工作搬去國產晶片,同時盡量留住供應有限嘅輝達 GPU,應付程式生成等較高價值服務。報道引述 Approaching.AI 副總裁關嘉偉,將市場需求分成「高品質」同「低品質」token。不過呢個講法屬業界商業分類,唔係一個有統一量度方法嘅硬件指標,解讀時要小心。
換卡背後係成套開發環境
企業用輝達,買到嘅除咗 GPU,仲有 CUDA 編譯器、數學函式庫、除錯及效能分析工具,同 PyTorch、vLLM 等常用框架累積多年嘅支援。輝達自己嘅 CUDA 資料 都列出由程式語言、函式庫到分散式推理框架嘅完整工具鏈。模型程式一旦用咗 CUDA 專用 kernel、量化工具或者通訊函式庫,搬去另一種加速器就可能要逐層檢查,唔係改一個裝置名稱就跑得穩。
華為昇騰已經有 CANN 同 TorchNPU,開發者亦可以沿用 PyTorch 寫法,唔可以話佢毫無進展。不過昇騰官方維護嘅 TorchNPU 兼容表 顯示,TorchNPU、PyTorch、CANN、Python、驅動同韌體都有指定配搭。呢類版本矩陣唔代表平台一定難用,但反映企業要鎖實環境、重做測試,同時追住上游框架更新;模型每次轉架構或者加入新算子,工程團隊都要再確認支援情況。
推理較易搬,唔等於所有推理都一樣
訓練要長時間同步大量加速器,中途有節點出錯,成次訓練都可能受影響。固定模型、批量處理嘅推理通常較易切去另一套硬件,亦方便按個別算子慢慢調校。不過程式助理同 agent 會讀長 context、反覆產生內容、呼叫工具再驗證結果,一個要求可能拆成好多輪模型運算,對 RAM、通訊、排程同延遲都有壓力。程式生成本身冇一條定律話只可以用輝達;實際差距要睇模型、精度、量化方式、批次大小同服務框架,唔可以用「寫 code 較複雜」一句概括。
跑得到同長期服務係兩回事
一份 2026 年 7 月公開、但未經同儕審查嘅 昇騰推理實地研究,記錄團隊喺 16 張 Ascend 910 上部署 MoE 同多模態工作。研究者話要為供應商插件加入 12 個程式修補,關閉部分高吞吐功能先維持數值正確,亦要額外處理裝置故障、監察不足同平行運算不穩。呢個只係特定系統同兩個工作負載,唔足以推論所有中國晶片;不過佢清楚示範,生產環境嘅成本會落喺除錯、監察、故障復原同當值人手,晶片規格表睇唔到呢幾項。
企業自然會分流:成熟、可預測、容易批量處理嘅推理先搬去國產平台;至於對延遲、輸出準確度同持續運行時間要求高嘅工作,就繼續放喺團隊最熟悉嘅 CUDA 環境。咁做可以減少輝達用量,不過同時要養兩套容器、驅動、模型版本同監察系統,混合叢集本身又添一層運維複雜度。所謂「壓榨稀缺算力」,實際多數係將 GPU 留畀付費較高或者出錯代價較大嘅請求。
Token 數量唔等同所需算力
中國國家數據局話,2026 年 3 月日均 token 呼叫量已超過 140 萬億,較 2024 年初多逾 1,000 倍。個升幅證明 AI 服務流量擴張得好快,但 token 會受 tokenizer、輸入輸出比例、快取命中率同模型大小影響,唔可以直接換算成 GPU 數量或者營收。下一步較有參考價值嘅指標,會係國產平台支援新模型同新算子嘅速度、叢集正常運行時間,同每個成功完成任務嘅總成本。
參考來源
- TechNews 科技新報 — 中國 AI 晶片程式能力卡關,企業被迫「極限壓榨」稀缺輝達算力 — original report
- Chinese AI chips fall short on coding, forcing firms to stretch scarce Nvidia supply — TechNews 報道採用嘅主要英文來源,用嚟核對原始訪問脈絡。
- CUDA Platform for Accelerated Computing — 輝達官方資料,說明 CUDA 包含函式庫、編譯器、開發工具同 AI 框架支援。
- Ascend TorchNPU Compatibility — 昇騰官方維護嘅版本配搭資料,顯示 TorchNPU、PyTorch、CANN、Python 同硬件之間嘅兼容要求。
- On the Limitations of Non-GPU AI Accelerators for Large-Model Inference — 2026 年昇騰推理部署個案,提供插件修補、算子支援、並行運算、監察同穩定性資料;論文未經同儕審查。
- 新華社|Token 中文名定了! — 國家數據局轉載資料,用嚟核對 2026 年 3 月日均 token 呼叫量同增幅。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







