兩部 Dell Pro Max GB10 跑 284B 大模型,細機 cluster 頂唔頂到多 GPU server?
3C 產品

兩部 Dell Pro Max GB10 跑 284B 大模型,細機 cluster 頂唔頂到多 GPU server?

圖片:via Tom's Hardware — https://www.tomshardware.com/pc-components/gpus/local-ai-clustering-with-dells-pro-max-gb10-connecting-two-nvidia-grace-blackwell-to-scale-out-ai-compute-at-home
TechLab 編輯部(譯)·

256GB 統一記憶體夠大,但速度、價錢同設定都有代價

Tom’s Hardware 今次將兩部 Dell Pro Max with GB10 用 200Gbps QSFP 直連,砌成一套有 256GB 統一記憶體嘅本地 AI cluster。重點唔止係部機細,而係佢成功載入單部 128GB GB10 放唔落嘅 230B 至 284B 模型,仲可以保持到實際有得用嘅生成速度。對想喺公司內部跑大模型、又冇位擺四張專業 GPU server 嘅團隊,呢條路開始有現實意義。

雙機最大優勢係記憶體容量

每部 Pro Max with GB10 有 128GB LPDDR5X 統一記憶體、GB10 Grace Blackwell、6,144 個 CUDA core,同埋 ConnectX-7 200Gbps network 介面。兩部連埋,模型權重可以分佈喺兩粒 GPU 上面。Nvidia 官方標示單機支援最高 200B 模型,雙機就去到約 405B;實際放得落幾大,仍然會受量化格式、context、KV cache 同推理引擎食幾多記憶體影響,唔可以見到「405B」就當任何同規模模型都必定跑到。

Tom’s Hardware 用 vLLM 同社群維護嘅 spark-vllm-docker,跑咗 284B、每個 token 啟用 18B 參數嘅 DeepSeek v4 Flash,亦載入咗 4-bit 量化、總共 230B 參數嘅 MiniMax M2.7。兩個模型本身都大過單部機舒服處理嘅範圍,所以呢次展示到嘅主要價值係容量擴充。原文冇提供同一模型喺單機或多 GPU server 嘅直接對照,單憑呢組數據量唔到跨機通訊究竟蝕咗幾多效能。

兩部 Dell Pro Max with GB10 疊放一齊嘅官方產品圖

圖片:Dell

34 token/s 夠傾偈,長 context 就要等

按 Tom’s Hardware 測試,DeepSeek v4 Flash 靠 multi-token prediction,由短 context 到 262,144-token context,生成速度大致維持喺 每秒 34 至 37 token。不過 time to first token 會由約 1.2 秒升到 157.2 秒,即係長文件塞得落,唔代表撳完即刻有反應。佢哋形容 200K token 大約相當於 333 頁 A4 文字,適合研究長文件、程式碼庫或者離線批次工作,多過追求雲端聊天服務嗰種爽快反應。

MiniMax M2.7 冇同一套多 token 預測優勢,差距就明顯好多。Tom’s Hardware 錄得生成速度由短 context 嘅 39.7 token/s,跌到 131,072-token context 嘅 11 token/s;首個 token 延遲亦由 0.8 秒升到 145.7 秒。換句話講,256GB 記憶體解決咗「放唔放得落」,模型架構、量化方法同推理軟件仍然直接左右好唔好用。

200Gbps 有硬件,設定照樣會卡住

兩部機要食盡 ConnectX-7,唔係駁條線就完。GB10 呢套介面只支援 Ethernet/RoCE,唔支援 InfiniBand 模式;每個實體 QSFP port 喺系統內仲會見到兩個邏輯介面。Tom’s Hardware 跟 spark-vllm-docker 指引設定 network、免密碼 SSH,再做 NCCL 測試,起初只攞到預期頻寬一小部分,最後發現第二部機有 fwupd 更新俾分階段更新機制卡住。強制更新韌體再重開,先接近 200Gbps 理論值對應嘅 25GB/s

呢次經歷亦反映到,成套方案仲未算好成熟:Nvidia 已經有官方雙機教學,社群亦有現成 script,但韌體版本、RoCE、固定 IP、SSH、container 同 vLLM 配方,任何一環唔對都會拖慢成套 cluster。熟手處理 Linux、Docker 同 network 設定嘅開發團隊未必覺得難,想買兩部返嚟當大型版 LM Studio appliance,就要預留時間處理更新同相容問題。

415W 同 40dBA,細工作室幾吸引

Tom’s Hardware 量到雙機推理時牆上功耗約 375W 至 415W,距離兩隻 280W 火牛合計上限仲有空間;負載噪音就係距離 18 吋約 40dBA。呢個規模放喺工作枱旁邊,生活質素確實好過四張 blower 專業 GPU 全速轉嘅大型 server,機身每部亦只係約 150 × 150 × 51mm。要留意,功耗同噪音全部係 Tom’s Hardware 測試環境數字,TechLab 冇親自量度。

原文用美國 15A、1,800W 電路做多 GPU server 對照,呢個講法唔應該直接搬落香港。香港用 220V 級別供電,電路規格同保護方式都唔同;真正有參考價值嘅係雙機實際約 415W。若果再加第三、第四部同 200G/400G switch,耗電仍然唔算高,不過 server 級 network 設備本身嘅噪音、散熱同成本亦要計埋。

港行兩部 HK$128,730,買緊一套專用工具

Dell 香港官網而家列出 2TB 版本,標價 HK$64,365,包括一年 Basic Onsite Service after remote diagnosis 硬件支援;兩部合計已經係 HK$128,730,仲未計 QSFP 線、儲存升級同支援升級。Tom’s Hardware 測試嘅則係兩部 4TB 美國配置,每部 US$6,332.18,雙機連線材合共約 US$12,714。

以純生成速度計,呢個價唔會令追求最高吞吐量嘅 GPU server 買家轉軚。Pro Max cluster 合理嘅客群係要將敏感資料留喺內部、模型大過 128GB、空間同噪音受限制,兼且團隊有人識維護 Linux AI stack。若果日常只跑 70B 級量化模型,單部 GB10 已經夠用;模型用量唔穩定或者只係間中試大型模型,租雲端 GPU 通常會輕鬆好多。呢套雙機方案值唔值,下一步要睇更多同多 GPU server 嘅同模型、同精度效能對照。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook