
兩部 Dell Pro Max GB10 跑 284B 大模型,細機 cluster 頂唔頂到多 GPU server?
256GB 統一記憶體夠大,但速度、價錢同設定都有代價
Tom’s Hardware 今次將兩部 Dell Pro Max with GB10 用 200Gbps QSFP 直連,砌成一套有 256GB 統一記憶體嘅本地 AI cluster。重點唔止係部機細,而係佢成功載入單部 128GB GB10 放唔落嘅 230B 至 284B 模型,仲可以保持到實際有得用嘅生成速度。對想喺公司內部跑大模型、又冇位擺四張專業 GPU server 嘅團隊,呢條路開始有現實意義。
雙機最大優勢係記憶體容量
每部 Pro Max with GB10 有 128GB LPDDR5X 統一記憶體、GB10 Grace Blackwell、6,144 個 CUDA core,同埋 ConnectX-7 200Gbps network 介面。兩部連埋,模型權重可以分佈喺兩粒 GPU 上面。Nvidia 官方標示單機支援最高 200B 模型,雙機就去到約 405B;實際放得落幾大,仍然會受量化格式、context、KV cache 同推理引擎食幾多記憶體影響,唔可以見到「405B」就當任何同規模模型都必定跑到。
Tom’s Hardware 用 vLLM 同社群維護嘅 spark-vllm-docker,跑咗 284B、每個 token 啟用 18B 參數嘅 DeepSeek v4 Flash,亦載入咗 4-bit 量化、總共 230B 參數嘅 MiniMax M2.7。兩個模型本身都大過單部機舒服處理嘅範圍,所以呢次展示到嘅主要價值係容量擴充。原文冇提供同一模型喺單機或多 GPU server 嘅直接對照,單憑呢組數據量唔到跨機通訊究竟蝕咗幾多效能。

圖片:Dell
34 token/s 夠傾偈,長 context 就要等
按 Tom’s Hardware 測試,DeepSeek v4 Flash 靠 multi-token prediction,由短 context 到 262,144-token context,生成速度大致維持喺 每秒 34 至 37 token。不過 time to first token 會由約 1.2 秒升到 157.2 秒,即係長文件塞得落,唔代表撳完即刻有反應。佢哋形容 200K token 大約相當於 333 頁 A4 文字,適合研究長文件、程式碼庫或者離線批次工作,多過追求雲端聊天服務嗰種爽快反應。
MiniMax M2.7 冇同一套多 token 預測優勢,差距就明顯好多。Tom’s Hardware 錄得生成速度由短 context 嘅 39.7 token/s,跌到 131,072-token context 嘅 11 token/s;首個 token 延遲亦由 0.8 秒升到 145.7 秒。換句話講,256GB 記憶體解決咗「放唔放得落」,模型架構、量化方法同推理軟件仍然直接左右好唔好用。
200Gbps 有硬件,設定照樣會卡住
兩部機要食盡 ConnectX-7,唔係駁條線就完。GB10 呢套介面只支援 Ethernet/RoCE,唔支援 InfiniBand 模式;每個實體 QSFP port 喺系統內仲會見到兩個邏輯介面。Tom’s Hardware 跟 spark-vllm-docker 指引設定 network、免密碼 SSH,再做 NCCL 測試,起初只攞到預期頻寬一小部分,最後發現第二部機有 fwupd 更新俾分階段更新機制卡住。強制更新韌體再重開,先接近 200Gbps 理論值對應嘅 25GB/s。
呢次經歷亦反映到,成套方案仲未算好成熟:Nvidia 已經有官方雙機教學,社群亦有現成 script,但韌體版本、RoCE、固定 IP、SSH、container 同 vLLM 配方,任何一環唔對都會拖慢成套 cluster。熟手處理 Linux、Docker 同 network 設定嘅開發團隊未必覺得難,想買兩部返嚟當大型版 LM Studio appliance,就要預留時間處理更新同相容問題。
415W 同 40dBA,細工作室幾吸引
Tom’s Hardware 量到雙機推理時牆上功耗約 375W 至 415W,距離兩隻 280W 火牛合計上限仲有空間;負載噪音就係距離 18 吋約 40dBA。呢個規模放喺工作枱旁邊,生活質素確實好過四張 blower 專業 GPU 全速轉嘅大型 server,機身每部亦只係約 150 × 150 × 51mm。要留意,功耗同噪音全部係 Tom’s Hardware 測試環境數字,TechLab 冇親自量度。
原文用美國 15A、1,800W 電路做多 GPU server 對照,呢個講法唔應該直接搬落香港。香港用 220V 級別供電,電路規格同保護方式都唔同;真正有參考價值嘅係雙機實際約 415W。若果再加第三、第四部同 200G/400G switch,耗電仍然唔算高,不過 server 級 network 設備本身嘅噪音、散熱同成本亦要計埋。
港行兩部 HK$128,730,買緊一套專用工具
Dell 香港官網而家列出 2TB 版本,標價 HK$64,365,包括一年 Basic Onsite Service after remote diagnosis 硬件支援;兩部合計已經係 HK$128,730,仲未計 QSFP 線、儲存升級同支援升級。Tom’s Hardware 測試嘅則係兩部 4TB 美國配置,每部 US$6,332.18,雙機連線材合共約 US$12,714。
以純生成速度計,呢個價唔會令追求最高吞吐量嘅 GPU server 買家轉軚。Pro Max cluster 合理嘅客群係要將敏感資料留喺內部、模型大過 128GB、空間同噪音受限制,兼且團隊有人識維護 Linux AI stack。若果日常只跑 70B 級量化模型,單部 GB10 已經夠用;模型用量唔穩定或者只係間中試大型模型,租雲端 GPU 通常會輕鬆好多。呢套雙機方案值唔值,下一步要睇更多同多 GPU server 嘅同模型、同精度效能對照。
參考來源
- Tom's Hardware — Local AI clustering with Dell's Pro Max GB10 — connecting two Nvidia Grace Blackwell to scale out AI compute at home — original report
- Dell Pro Max with GB10 香港產品頁 — 核對港行售價、2TB 配置、QSFP 選項同一年基本上門支援
- NVIDIA DGX Spark User Guide — 核對 GB10 規格、記憶體頻寬、功耗同單機/雙機模型規模上限
- NVIDIA Connect Two Sparks — 官方雙機 200GbE、網絡介面、IP 同 SSH 設定指引
- spark-vllm-docker — Tom’s Hardware 測試採用嘅社群多節點 vLLM 工具同模型配方
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







