Z.ai 建成 1GW 國產晶片 AI 中心:規模夠大,算力仲有幾關要過
3C 產品

Z.ai 建成 1GW 國產晶片 AI 中心:規模夠大,算力仲有幾關要過

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/artificial-intelligence/z-ai-powers-up-1gw-ai-data-center-built-entirely-on-chinese-chips
TechLab 編輯部(譯)·

部分設施已啟用,晶片型號、實際功耗同訓練效率仍未公開

1GW 聽落誇張,但要先搞清楚個數字

Bloomberg 引述匿名消息話,Z.ai 已經建成一座 1GW 級、全用中國製晶片嘅 AI 數據中心,部分設施開始運作,另外亦建成或營運緊多個一萬張晶片以上嘅 cluster。問題係報道冇公開地點、成本、晶片供應商同啟用比例,連 1GW 係電網接入容量、園區設計上限,定已裝好嘅 IT 負載都冇講清楚。現階段可以確認嘅,只係個園區規劃去到極大型水平,未可以當成一整座 1GW 機樓已經長期滿載訓練 GLM。

假設真係連續用盡 1GW,一年耗電會去到約 8.76TWh。不過數據中心嘅電唔會全部入晒加速器,CPU、交換器、儲存、供電轉換同散熱都要分一份,PUE 同設備使用率亦會拉開實際差距。再加上設施只係部分啟用,直接用 1GW 換算成幾多張 AI 晶片或者幾多訓練 FLOPS,其實冇乜意思。比較中美 AI 基建時,最少要睇埋晶片型號、精度、互聯效率同有效使用率,單計瓦數好容易高估成果。

華為喺 2026 世界人工智能大會公開展示昇騰 950 超節點實機

圖片:華為

華為機會最大,但未有正式硬件清單

報道冇點名晶片供應商,外界估華為 Ascend 係主力,亦唔係冇原因。Z.ai 嘅 GLM 系列已經有 Ascend、CANN、MindSpeed、vLLM-Ascend 同 SGLang 等部署路線;華為亦公開展示過 384 卡同 1,024 卡 SuperPoD,證明由單機去到大型 NPU 系統嘅產品鏈已經成形。Z.ai 自己又喺美國實體清單入面,正常取得受管制 Nvidia 高階晶片相當困難,長遠押注中國製硬件亦合乎現實。

不過「支援 Ascend」同「原始訓練全程只用 Ascend」係兩回事。Tom's Hardware 將 GLM-5.2 描述成用華為晶片、冇 Nvidia 參與,但 Z.ai 官方 GLM-5.2 發布頁主要交代模型架構、benchmark、API 同開源權重,冇列出預訓練晶片、數量或者完整硬件紀錄。華為嘅資料就確認 GLM-5.2 已完成 Ascend 推理適配同訓練重現支援,同樣未足以證明 Z.ai 原本嗰次訓練點樣做。所謂「全程零 Nvidia」,暫時仍要當成媒體報道,唔應該寫成有官方技術報告背書。

萬卡 cluster 最難搞嘅未必係卡本身

大型模型訓練要大量晶片同步交換資料,cluster 愈大,網絡延遲、通訊頻寬、故障率同 checkpoint 恢復時間愈難控制。華為 SuperPoD 可以先將數百至過千張 NPU 組成一個高頻寬系統,但一萬卡規模仍會橫跨多個節點,訓練效率取決於互聯架構、排程器、算子同軟件能否一齊配合。帳面有一萬張卡,假如長期要等通訊、處理故障或者改模型程式,有效算力可以同理論峰值差好遠。

呢度亦係 Nvidia 最難取代嘅部分。CUDA 生態累積多年,大型訓練框架、除錯工具同通訊庫已經相當成熟;Ascend 就要靠 CANN、MindSpore、MindSpeed 同各種 PyTorch 適配層追上。華為近年開放更多底層軟件,又支援 vLLM 同 SGLang,方向係啱,但 Z.ai 能否穩定跑完長時間、跨萬卡嘅 frontier model 訓練,始終要等公司公開使用率、故障數據或者訓練報告先判斷到。

功耗、HBM 同產能會一齊卡住擴充

中國製加速器現階段普遍要用更多晶片同系統工程,先補到單卡效能、記憶體頻寬或者每瓦效能差距。所以同樣係 1GW,實際交到嘅訓練量未必拍得住用較新 Nvidia 系統嘅 1GW 園區。呢個比較亦冇一組公開、同代兼相同模型嘅數據可以直接下結論;比較合理嘅講法,係 電力規模冇法代替有效算力指標,Z.ai 仲要證明個 cluster 用得夠盡。

供應鏈亦唔會因為機樓起好就自動解決。大型模型非常依賴 HBM 容量同頻寬,晶片本體、HBM、封裝同良率任何一環短缺,都會拖慢加速器出貨。中國先進製程產能本身緊張,HBM 又要追容量、速度同封裝能力,結果可能出現機樓、供電同散熱已經準備好,機櫃仍未填滿嘅情況。報道話設施只係部分啟用,亦反映「建成」同「裝滿兼全速運作」係兩回事。

對開發者有用,但未使急住相信規模敘事

對一般開發者,呢座中心最直接嘅影響係 Z.ai 有機會提供較穩定嘅 GLM coding API、長上下文服務同平價推理容量。GLM-5.2 已經可以經 Z.ai Coding Plan 使用;華為雲國際站嘅 MaaS 文件亦列出 GLM 系列支援 CN-Hong Kong 區域,最新模型頁已加入 GLM-5.2。不過雲端有模型可用,同 Z.ai 嗰座 1GW 設施係咪負責供應香港區服務,兩邊暫時冇公開資料可以直接連起來。

如果報道資料準確,Z.ai 呢個項目反映中國 AI 公司正嘗試規劃大型、避開受管制外國晶片嘅基建。下一步要睇嘅資料好實際:設施啟用咗幾多、裝咩晶片、訓練使用率有幾高、每個 token 耗幾多電,同 GLM 下一代模型有冇公開完整訓練紀錄。未有呢批數據之前,1GW 係一個幾有份量嘅工程進度,仲未足以代表佢已經追平 Nvidia cluster 嘅有效算力。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook