
AMD Helios 規格正式落實:72 張 MI455X 點樣挑戰 Nvidia AI 機櫃
開放機櫃、網絡同 ROCm,背後係雲端巨頭分散算力供應
AMD 舊年已經預告 Helios,CES 2026 亦搬過實機上台,所以今次重點唔只係「又有新 AI 機櫃」。AMD 而家交出完整架構、出貨時間同一批夠分量嘅客戶:Microsoft、OpenAI 同 Anthropic 已公布部署安排,Meta 同 Oracle 亦有份支持 AMD 呢套機架級生態。對一間過往主要賣獨立 GPU 同 CPU 嘅公司嚟講,Helios 代表 AMD 終於有一套由晶片、網絡、軟件到機櫃一齊設計嘅方案,可以正面爭 Nvidia 嘅 Vera Rubin NVL72 生意。
72 張 MI455X,成個機櫃先係產品
一套 Helios 裝有 72 張 CDNA 5 架構嘅 Instinct MI455X GPU,配搭第六代 EPYC「Venice」CPU、Pensando「Vulcano」AI NIC、Salina DPU 同液冷系統。AMD 公布嘅成櫃規格包括 31TB HBM4、1.4 exaFLOPS FP8、2.9 exaFLOPS FP4、260TB/s scale-up 頻寬,同 43TB/s scale-out 頻寬。Venice 最多有 256 核心,主要負責餵資料、控制工作同撐住大量 GPU 一齊運作;Pensando 就接手跨機櫃流量、儲存同保安工作,減少 CPU 喺資料搬運上嘅負擔。
呢堆數字全部來自 AMD,當中運算效能更係廠方計算嘅理論峰值,未有獨立機構用完整量產機櫃跑訓練或推理 workload。FP4、FP8 數字亦會受資料格式、模型、batch size 同軟件調校影響,直接將兩間廠嘅 FLOPS 擺埋一齊,未必等於實際每秒可以產生幾多 token。Helios 紙面上已經入到 NVL72 同一級別,但「最快 AI 機櫃」呢句暫時仍然係 AMD 嘅宣傳說法。
HBM 容量搶眼,網絡先決定用唔用得盡
按兩間廠公開規格計,Helios 嘅 31TB HBM4 容量高過 Vera Rubin NVL72 約一半。大記憶體對超大型模型、長 context、KV cache 同分散式推理有實際用途,可以減少模型切割同跨節點搬資料。不過 Nvidia Rubin 每張 GPU 公布有 288GB HBM4、22TB/s 記憶體頻寬,單卡頻寬同整套系統點樣維持高使用率,同樣影響最終表現。容量較大係優勢,但唔代表 GPU 一定長期跑得飽。
Helios 用 UALink over Ethernet 將 72 張 GPU 接成一個 scale-up domain,再用 Pensando Ethernet 做 scale-out。AMD 聲稱 43TB/s scale-out 頻寬高過對手逾 50%,不過呢個都係官方比較,UALink over Ethernet 喺大量 collective communication、擠塞同故障情況下有幾穩,仲要睇量產部署。Nvidia 嘅 NVLink、NVSwitch 同 Spectrum-X 已經跑過幾代大型叢集,成熟度係 AMD 要追嘅部分。
「開放」係俾大客多一張牌
Helios 跟 Meta 提交畀 Open Compute Project 嘅雙闊度 Open Rack Wide 規格,scale-up 用 UALink,跨機櫃網絡亦靠 Ultra Ethernet 生態。佢其實係參考設計,AMD唔會直接賣一櫃 Helios 畀客;Dell、HPE、Lenovo、Supermicro 等 OEM/ODM 會按藍圖整自己嘅系統。雲端巨頭可以揀網絡、機櫃同供應商,亦較容易將部件放入現有數據中心設計,採購時自然多啲議價空間。
不過開放標準冇辦法即時消除軟件成本。Helios 跑 ROCm,AMD 已經支援 PyTorch、TensorFlow、JAX、vLLM、Triton 同 ONNX Runtime,HIPIFY 亦可以協助將 CUDA 程式碼轉成 HIP。真正麻煩往往係自訂 kernel、通訊函式庫、監察工具同多年累積嘅調校。大型 AI 公司有工程團隊逐個 workload 執效能,中小企多數會直接租雲端實例,根本唔會掂底層程式碼。ROCm 可以幫手慳到幾多改模型同調校嘅工夫,會直接影響部署成本。
Azure 先推推理,實際價錢仲未公布
Microsoft 已確認會喺 Azure 大規模採用 Helios,首批系統由 2026 下半年開始出貨,初期用途包括 frontier model 推理、Azure AI 服務同客戶應用。OpenAI 公布首個 1GW MI450 系列部署同樣排喺 2026 下半年;Anthropic 計劃部署最多 2GW,首個 1GW 就排喺 2027 上半年。呢啲承諾證明 AMD 已經攞到入場券,但「出貨」、「裝好」同「公開俾雲端客租用」係三個時間點,Azure 暫時冇公布 Helios 實例推出日期或收費。
對一般公司同開發者,最實際嘅變化會係雲端平台多一種 GPU 選擇。假如 Helios 可以用較低租金維持接近 NVL72 嘅 token throughput,推理 API、模型託管同批量生成成本先有機會向下走;如果 workload 要花大量人手改寫同調校,硬件平啲都可能補唔返工程成本。下一步要睇量產系統嘅 uptime、耗電、實際 token 數據,同 Azure 幾時公開價目。
參考來源
- TechCrunch — AMD takes on Nvidia with its Helios AI rack scale system — original report
- AMD Helios 產品頁 — 核對 72 GPU 配置、運算及網絡規格、開放標準、參考設計定位同官方數據註腳
- AMD 與 Microsoft 擴大 Azure 合作 — 確認 Azure 部署用途、Pensando 整合及 2026 下半年出貨安排
- AMD 與 Anthropic 策略合作公告 — 確認最多 2GW 部署規模、首批時間同 ROCm 聯合調校計劃
- AMD 與 OpenAI 部署協議 — 確認首個 1GW MI450 系列部署時間同多代合作安排
- Nvidia Rubin GPU 架構資料 — 核對 Rubin HBM4、NVLink 同 Vera Rubin NVL72 架構背景
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







