Anthropic預留最多2GW AMD算力:Claude幫手追ROCm軟件差距
Tech News

Anthropic預留最多2GW AMD算力:Claude幫手追ROCm軟件差距

圖片:via iThome — https://www.ithome.com.tw/news/177575
TechLab 編輯部(譯)·

首批系統要等到2027年,50億美元投資亦同部署進度掛鈎

AMD同Anthropic簽咗一份多年合作,Anthropic計劃部署最多2GW AMD Instinct MI450系列GPU,首批1GW會喺2027年上半年開始。系統用MI455X GPU、EPYC「Venice」CPU、Pensando網絡同ROCm軟件砌成,訓練模型同運行Claude都會用到。兩個關鍵字係「最多」同「開始」:2GW未等於全部落實,2027年上半年亦只係首批系統起步。

2GW係成個數據中心群嘅級數

呢度嘅GW講緊運算基建所需嘅電力規模,2GW即係20億瓦,唔係某款GPU嘅耗電量。Reuters引述AMD管理層指,1GW運算容量涉及過百億美元成本,所需電力大約足夠供應75萬個美國家庭。呢個比較只係幫手捉住量級,民居用電同數據中心負載唔可以直接對換;不過2GW部署必然要有大規模機房、供電、散熱同網絡配合,唔係買幾櫃GPU咁簡單。

Anthropic要幾條算力供應線

Anthropic原本已經用緊AMD MI355X。iThome報道亦指出,佢同時用Nvidia GPU、Google TPU同Amazon Trainium,今次擴大AMD部署,方向仍然係將工作量分散畀唔同平台。前沿模型公司燒算力嘅速度太快,只靠單一供應商會同時面對價格、交貨期同供應風險。MI450做到預期表現嘅話,AMD會多一個旗艦客戶;Anthropic亦多一張牌,可以按訓練、推理同成本揀硬件。

Claude會直接幫手執ROCm

今次最有意思嘅條款其實喺軟件。AMD話雙方會合作多年,用Claude優化Instinct GPU工作量、加快ROCm開發,AMD內部工程同產品團隊亦會廣泛採用Claude。AMD只講到雙方會用Claude優化Instinct工作量同加快ROCm開發;如果合作涵蓋Anthropic嘅實際生產工作量,AMD就有機會更快搵到ROCm邊度卡住。

Kearney嘅AI基建分析指,ROCm已支援PyTorch、Hugging Face同Triton,不過模型轉換、動態shape、多GPU調度、除錯同效能分析工具仍落後CUDA。有客戶直接回報實際工作量遇到嘅問題,AMD就唔使淨係靠內部測試推斷。Anthropic若果真係把Claude大規模搬上MI450,工程團隊每日撞到嘅問題會變成ROCm改進清單,效果會實在過一輪宣傳benchmark。一般開發者幾時受惠,就要睇相關修正有幾多會進入公開工具鏈。

50億美元帶住循環融資味道

iThome引述《華爾街日報》話,整批AI server價值達數百億美元;Anthropic會自行買一部分,其他容量就向大型雲端供應商或AI雲端公司租用。另一邊,AMD承諾向Anthropic作最多50億美元股權投資。Reuters指款項會跟指定部署里程碑發放,而AMD官方只確認日後投資最多50億美元,冇公開完整時間表同每階段金額。

晶片商投資AI公司,AI公司再採購相關硬件,資金確實繞咗一圈。里程碑條款可以減低AMD一次過落重注嘅風險,但投資額、採購需求同帳面收入仍要分開睇。現階段公開資料亦冇證明呢宗合作會令Claude收費下降、服務變快,或者改善個別地區嘅供應情況,呢幾點都唔應該由2GW數字自行推斷。

一張大單未足以鬆開CUDA綁定

Nvidia嘅優勢累積咗多年,開發工具、library、文件同工程人才都圍住CUDA運作,單靠一份2027年先起步嘅合約追唔返。呢宗合作對AMD仍然重要,因為ROCm多咗一個前沿模型客戶長期落手改,亦證明Anthropic肯把部分核心工作量交畀Nvidia以外嘅平台。首批MI450系統上線後,值得睇嘅訊號會係部署有冇按期擴大、ROCm修正有冇公開,同Claude工作量搬過去要改幾多code。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook