華為 AI 晶片一年取代 Nvidia?流傳講法仲欠效能、耗電同生態實證
Tech News

華為 AI 晶片一年取代 Nvidia?流傳講法仲欠效能、耗電同生態實證

圖片:via TechNews 科技新報 — https://technews.tw/2026/07/24/deepseeks-liang-wenfeng-tells-investors-restraint-is-the-business-model/
TechLab 編輯部(譯)·

投資者會議稿未獲確認,官方資料只證明產品已經亮相

TechNews 科技新報報道,一份流傳嘅投資者會議紀錄將多個講法歸於 DeepSeek 創辦人梁文鋒,包括華為晶片大約四張先追到一張 Nvidia、DeepSeek 可能取得約 1.6 萬張 Ascend 950,同中國一年左右可以大幅減少依賴 Nvidia。數字夠搶眼,不過成件事最值得拆嘅地方,正正係「有替代品」同「換得過」之間仲隔住幾多工程同成本。

先搞清楚:呢份紀錄未獲 DeepSeek 確認

科技行者整理頁寫明,材料來自 WeChat 流傳嘅 PDF,似係 AI 轉錄,未獲梁文鋒或者 DeepSeek 確認。文件標示嘅音訊日期同整理者推算嘅會議日子亦對唔上。TechNews 科技新報據呢份材料報道,但未補到錄音、與會者確認或者 DeepSeek 官方聲明。所以「四比一」、約 2 萬張 H100 等效算力、1.6 萬張 950 卡同一年時間表,全部都係 [待確認],現階段唔適合當公司正式披露。

華為喺 MWC 展示 Atlas 950 SuperPoD 等大型運算系統

圖片:Huawei

四張追一張,算唔出成套系統抵唔抵

就算暫時接受流傳稿嘅四比一估算,呢個比例仍然欠咗測試工作、數據格式、模型大小、功耗同集群使用率。訓練、批量推理、低延遲 API 各有唔同樽頸,一個 FP8 峰值亦代表唔到每秒可以穩定交付幾多 token。華為官方確認 Atlas 950 SuperPoD 最多連接 8,192 粒 Ascend NPU,靠 UnifiedBus 將大量晶片砌成一部邏輯電腦;呢條路可以用系統規模補單粒晶片差距,不過晶片越多,網絡、散熱、故障處理同調度難度亦會一齊升。

耗電仲唔可以略過。SemiAnalysis 分析上一代 CloudMatrix 384 時,估算佢用電約係 GB200 NVL72 嘅 4.1 倍,而每 FLOP 能源效率亦差一截。呢組數字講緊 Ascend 910C 系統,唔可以直接套落 Atlas 950,不過已經示範咗堆更多晶片追總效能要付咩代價。電費、液冷、機房供電同可用機架位都會入帳,晶片單價平啲,總持有成本仍然可以貴過預期。

發布咗 SuperPoD,唔等於有足夠供應

華為已經公開展示 Atlas 950 SuperPoD,官方資料亦講到最多 8,192 粒 NPU 嘅配置。不過產品亮相、客戶開始收貨、產量足以支撐大型訓練集群,係三個唔同階段。暫時未見華為或者 DeepSeek 一手確認 1.6 萬張卡嘅訂單、交付進度同可用率。尤其前沿模型訓練會連續佔用大量晶片,一批卡到齊之後,仲要睇互連、儲存同軟件可唔可以穩定跑足數星期。

計折舊唔可以淨係睇財務報表上嗰條年期。AI 晶片更新得快,新一代可能用較少電完成同一工作;舊集群未供完,單位 token 成本已經落後。公司評估 Ascend 時,要將採購價、機房改裝、工程團隊時間、停機風險同下一代晶片時間表放埋一齊計。缺 Nvidia 貨嘅公司可能接受較高成本換取供應,但有得揀嘅客戶,門檻自然高好多。

CUDA 護城河有缺口,但搬家仲會撞牆

華為正開放 CANN 多個軟件層,vLLM-Ascend 亦已成為社群維護嘅硬件插件,支援多類 Transformer、MoE 同多模態模型。呢啲進展確實令 Ascend 易用過以前,亦令開源模型較容易同時照顧多款晶片。不過「有 PyTorch 同 vLLM 支援」只代表基本路徑行得通,自訂 operator、量化、分散式訓練、監控同除錯工具仍然會拉開日常使用差距。

一篇 2026 年 7 月公開嘅 Ascend 部署研究,喺 16 張卡上跑兩款大型推理工作時,要改 12 處插件源碼,又要關掉部分高吞吐功能先維持數值正確。呢個只係單一研究,測嘅亦唔係 Ascend 950,所以唔足以判定整個平台表現;但佢清楚指出,遷移成本會藏喺 operator 覆蓋、編譯器、平行運算穩定性同監控入面。AI 可以幫手改 code,卻唔會自動消除硬件故障同數值誤差。

中美差距講成只差算力,仍然太簡化

流傳稿將梁文鋒嘅判斷概括成中國唔缺人才,主要輸喺運算資源。運算力不足的確會減少實驗次數、模型規模同試錯空間,開源團隊亦較難追上每隔幾個月更新嘅前沿模型。不過材料本身同時提到高質素數據、標註同訓練流程要時間累積。晶片供應改善可以加快研發,卻補唔返多年建立嘅數據管線、工程工具同集群營運經驗,所以呢句較適合視為梁文鋒嘅產業判斷,唔係獨立技術結論。

至於用 DeepSeek API 或內地雲端 AI 服務嘅公司,底層行 Nvidia 定 Ascend,初期可能完全感覺唔到。實際要計嘅係 API 價格會唔會穩定、延遲同可用率有冇保證、模型更新會唔會改輸出,同日後搬去另一個供應商要改幾多 code。下一步要睇華為實際交付量、獨立 Atlas 950 工作負載測試,同 DeepSeek 會唔會正式確認呢份會議材料。呢三方面未有答案之前,仍然未有足夠證據支持「一年取代」呢個講法。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook