AMD 用 MI450 接入 Claude 算力池,ROCm 終於等到重量級實戰
3C 產品

AMD 用 MI450 接入 Claude 算力池,ROCm 終於等到重量級實戰

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/amd-to-supply-anthropic-with-2-gigawatts-of-instinct-mi450-gpus
TechLab 編輯部(譯)·

Anthropic 已用 MI355X,下一步會同 AMD 一齊磨 ROCm

AMD 同 Anthropic 公布合作,後者計劃喺 Helios 系統部署最多 2GW Instinct MI450 系列 GPU,首批 1GW 預計 2027 年上半年開始部署。AMD 亦承諾日後向 Anthropic 投資最多 50 億美元。數字睇落誇張,不過「最多」同「開始部署」都要睇清楚:完整規模、投資時間同細節暫時冇公開,距離機器真正承擔大量 Claude 工作仲有一段路。

Claude 原來已經用緊 AMD

今次最實在嘅新資料,反而係 Anthropic 首次確認現有系統已經用緊 Instinct MI355X。兩間公司冇交代佢負責訓練、推理抑或其他工作,所以唔適合再估落去;不過至少可以確認,AMD 現役 MI355X 已經入咗 Claude 嘅算力供應鏈,雙方合作唔係由 2027 年先開始。對講咗多年「Nvidia 以外選擇」嘅 AMD,呢個生產環境經驗比宣傳片有用得多。

Anthropic 本身一直分散算力來源,AWS Trainium、Google TPU 同 Nvidia GPU 都有用,AWS 仍然係主要雲端同訓練夥伴。加入 AMD 之後,佢可以按工作特性、供應量同成本分配任務,亦減少單一平台供貨緊張時嘅壓力。呢種安排未必即刻搶走 Nvidia 現有工作,但新增算力唔再自然全部流入 CUDA 生態,已經足以令 Nvidia 要守得辛苦啲。

Helios 規格夠搶眼,數字要識睇

Anthropic 計劃用嘅 Helios rack 會配 72 粒 MI455X、EPYC「Venice」CPU、Pensando 網絡硬件同 ROCm。AMD 官方列出每 rack 有 31TB HBM4,FP4 理論峰值最高 2.9 exaFLOPS;呢啲係 AMD 公布嘅產品規格同理論峰值,實際結果仍可能改動,亦唔代表 Claude 回覆會按比例加速。模型切分、網絡通訊、軟件最佳化同數據中心供電,任何一環跟唔上都會食走紙面優勢。

2GW 本身亦係電力規模,唔係 GPU 數量或者可直接換算嘅 API 容量。首批系統順利部署,最多只能話 Anthropic 多咗一條擴充路線;Claude 會唔會少啲限流、API 會唔會減價、coding agent 會唔會快咗,仲要睇實際投入服務嘅容量、工作分配同 Anthropic 點定價,單憑採購公布答唔到。

真正要磨嘅係 ROCm

AMD 同 Anthropic 會展開多年工程合作,用 Claude 幫手改善 Instinct 工作負載同加快 ROCm 開發,AMD 內部亦會廣泛採用 Claude。呢部分對競爭格局幾關鍵:大型 AI 系統要遷離 Nvidia,麻煩往往唔止改幾行程式,仲包括 kernel、通訊庫、監察工具、除錯流程同整套維運經驗。Anthropic 同時用多種晶片,正好有足夠複雜嘅真實工作逼出 ROCm 問題,改善成果亦有機會惠及其他 AMD 用戶。

對一般 Claude 或 API 用家,底層轉用咩 GPU 多數唔使改 workflow,短期亦未必感受到分別。較直接受影響嘅係自建模型、維護推理平台同寫 GPU kernel 嘅團隊:如果 ROCm 經過 Claude 呢種規模磨練後,工具、相容性同穩定性真係追近 CUDA,採購 AMD 先會少一截軟件風險。下一步要睇首批 Helios 能否按期部署,同 Anthropic 會唔會公開 MI355X、MI455X 實際負責邊類工作。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook