
Microsoft 大手引入 AMD Helios,Azure AI 算力多一條供應線
72 張 MI455X 組成開放式機櫃,直接迎戰 Nvidia Vera Rubin
Microsoft 宣布會喺 Azure 大規模部署 AMD Helios,服務自家 frontier model、Azure AI 基建客戶同 Microsoft Foundry。今次唔只係多租一款 GPU 咁簡單:Azure 已經有 MI300X VM,而 Helios 再行前一步,成套 CPU、GPU、網絡同液冷機櫃一齊設計,目標係處理大模型訓練同高吞吐量推論。Microsoft 冇公開會買幾多櫃、涉及幾多電力或者合約金額,所以「大規模」暫時只係方向,未係一張可以計數嘅訂單。
Helios 賣嘅係成櫃架構
一櫃 Helios 會放入 72 張 AMD Instinct MI455X GPU,配搭第六代 EPYC「Venice」CPU、Pensando 網絡硬件同 ROCm 軟件。要留意原報道標題寫成「Radeon Instinct MI455X」,AMD 官方產品名其實係 AMD Instinct MI455X。Helios 本身亦係畀 OEM、ODM 採用嘅參考設計,唔係 AMD 直接賣畀客戶嘅固定型號;Microsoft 今次等於幫呢套開放式設計攞到一個重要 hyperscaler 使用案例。
AMD 官方標稱,完整 Helios 有約 31TB HBM4、1.4 exaFLOPS FP8、2.9 exaFLOPS FP4、260TB/s 櫃內 scale-up 頻寬,同埋 43TB/s scale-out 頻寬。全部都係 AMD 內部分析或者理論峰值,產品正式推出前仍可改動,亦冇獨立實測支持。 單睇數字,31TB HBM4 對大型模型、KV cache 同長 context 推論都幾吸引。實際吞吐量仲要睇軟件調校、通訊延遲、功耗限制同模型類型。

圖片:Nvidia
同 Vera Rubin 走兩條路
Nvidia Vera Rubin NVL72 同樣用 72 張 GPU,官方列出 20.7TB HBM4、260TB/s NVLink 6 switch 頻寬、3.6 exaFLOPS NVFP4 推論同 2.52 exaFLOPS NVFP4 訓練。呢啲數字採用嘅資料格式同計算定義未必同 AMD 完全一致,唔適合直接排一張勝負表。可以確定嘅係 AMD 紙面記憶體容量較大;Nvidia 就用 NVLink、ConnectX、BlueField 同 CUDA 組成一套控制得更完整嘅平台。
Helios 最大分別係用 OCP Open Rack Wide、UALink over Ethernet 同 Ultra Ethernet 呢批開放標準。Tom’s Hardware 按廠方資料形容佢嘅 scale-out 頻寬大約係 Vera Rubin 兩倍,不過 UALink over Ethernet 喺 72 GPU 甚至跨櫃負載下有幾穩、延遲控制成點,而家未有獨立結果。Nvidia 嗰套封閉啲,但 NVLink 同 CUDA 生態已經跑咗好多代;AMD 開放啲,代價係要證明硬件、網絡同 ROCm 真係可以一齊交到穩定表現。
Microsoft 點解要多一個供應來源
AI datacenter 最大問題往往係「有冇貨」同每個 token 成本,唔係邊張規格表最靚。Azure 同時用 Nvidia GPU、AMD Instinct、自家 Maia accelerator,再加入 Helios,可以擴闊供應、按工作分配硬件,採購議價亦多啲空間。呢件事對 AMD 嘅意義尤其大:有 Microsoft 負責整合 Azure 網絡、儲存、監控同 Foundry 服務,企業唔使自己由零砌一個 Helios cluster,AMD 先有機會由第二供應來源變成常規選項。
不過對開發者嚟講,多一款 GPU 唔代表現有 CUDA workload 撳個掣就搬得過去。PyTorch、JAX、vLLM 呢類框架可以喺 ROCm 上行,但自訂 CUDA kernel、第三方 extension、通訊 library 同監控工具仍可能要改。最後企業會唔會揀 Helios,會睇 Azure 提供咩 VM 或 managed service、實際 token 吞吐量、穩定性同價錢;峰值 FLOPS 只係起點。
Venice VM 係另一條產品線
Microsoft 同時預告兩款採用 EPYC Venice 嘅 Azure VM:HDv2 針對 agentic AI 同 data pipeline,HXv2 就面向晶片設計工作。今次公布嘅兩款都係 CPU VM,唔好同 72-GPU Helios 當成同一項服務。Microsoft 亦會將 Pensando DPU 嘅經驗用喺 Azure Boost,分擔網絡同儲存工作。不過 HDv2、HXv2 同 Helios 嘅正式供應日、區域、完整 VM 規格同價錢全部未公布。
香港 Azure 企業客戶同 AI 團隊日後可能多一個訓練及推論算力選擇,但而家未確認香港區域會唔會提供、幾時上線或者點收費。下一步要睇 Azure 公開實際 SKU,同埋 Helios 上線後有冇第三方用相同模型比較吞吐量、延遲、功耗同每 token 成本。
參考來源
- Tom's Hardware — Microsoft will deploy AMD’s Helios rack-scale AI accelerator ‘at scale’ on Azure – Radeon Instinct MI455X and Epyc Venice power will be available through Redmond’s cloud infrastructure — original report
- AMD Helios Rackscale Solution — AMD 官方產品頁,核對 MI455X 名稱、整櫃規格、開放標準、參考設計定位同預計部署時間。
- NVIDIA Vera Rubin NVL72 — Nvidia 官方產品頁,用嚟核對 NVL72 配置、記憶體、計算格式同 NVLink 頻寬。
- ND-MI300X-v5 size series — Microsoft 官方文件,確認 Azure 已有 AMD Instinct MI300X VM 同 ROCm cluster 支援。
- AMD Helios — AI Rack Built on Meta’s 2025 OCP Design — AMD 官方背景資料,解釋 Helios 同 OCP Open Rack Wide 嘅關係,以及規格屬工程推算。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







