兩部 DGX Spark 跑 DeepSeek V4 Flash:所謂追上雲端講緊邊樣?
3C 產品

兩部 DGX Spark 跑 DeepSeek V4 Flash:所謂追上雲端講緊邊樣?

圖片:via XDA Developers — https://www.xda-developers.com/running-284-billion-parameter-model-two-machines-matches-cloud/
TechLab 編輯部(譯)·

速度快近三倍、毋須再壓到 2-bit,但九千幾美元買兩部機仍然好難計得掂。

兩部細細部嘅 AI 工作站,真係可以令 284B 參數模型用起上嚟似雲端 API?XDA 編輯 Adam Conway 將 DeepSeek V4 Flash 拆開放入兩部 NVIDIA DGX Spark,結果由單機每秒 10 至 14 token,升到一般文字每秒 36 至 41 token,處理 code 時更試過衝上 76。數字幾搶眼,不過先講清楚:兩部機由 NVIDIA 借出,而以下效能、功耗同成本全部都係 XDA 測試,唔係 TechLab 實測。

284B 唔代表每次都計足 284B

DeepSeek V4 Flash 係 MoE 模型,官方資料寫明總共有 284B 參數,每個 token 啟用 13B,支援 100 萬 token context。總參數決定模型權重要佔幾多空間,啟用參數就較影響每步運算量,兩件事唔可以撈埋講。官方模型本身亦採用混合精度:MoE experts 用 FP4,其餘大部分參數用 FP8,所以 XDA 所講嘅「原生 FP8」,準確啲應理解成毋須再將 routed experts 額外壓到 2-bit,而唔係全副模型每個部分都用 FP8。

之前單部 128GB ThinkStation PGX 要靠 ds4 將大部分 experts 壓到約 2-bit,先塞得入記憶體。ds4 作者話呢套非對稱量化會保留 shared experts、projection 同 routing 精度,不過 XDA 作者喺長 context 仍然見過模型答到散晒。今次兩部 Spark 各有 128GB unified memory,經 ConnectX-7 分擔權重,每部只讀自己嗰半,兩條 273GB/s 記憶體通道亦可以同時開工,速度先有接近三倍升幅。

NVIDIA DGX Spark 細型桌面 AI 工作站官方產品圖

圖片:NVIDIA

快幾多,好睇工作量

XDA 測到 prompt processing 約每秒 1,300 至 1,900 token,用大型 code repository 時,等候時間短過單機好多。DSpark speculative decoding 會先估最多五個後續 token,作者兩日使用錄得平均 55.1% draft acceptance;寫 code 規律較強,峰值去到每秒 76 token,另一項工作甚至短暫錄得 106.7。不過混合工具呼叫、JSON、推理同改檔案嘅 agent 工作,速度會跌返落嚟,呢啲峰值唔應當成固定吞吐量。

第二部機亦唔會帶嚟足足兩倍效能。DeepSeek V4 Flash 嘅 KV cache 會喺兩個 node 各自保留一份,context 去到十萬 token 以上,兩邊都要重讀同一批資料。XDA 用隨機 prompt 測試時,ConnectX-7 配合 RDMA 有每秒 17.1 token,轉用普通 10GbE 得返 9.2;每次 forward pass 都要同步 86 次,用普通網線時,延遲就成為最大樽頸。即係淨係湊夠 256GB RAM 未夠,互連方式同推理框架同樣會卡住成套機。

「追上雲端」暫時未有完整證據

XDA 今次冇用一套公開題目,逐題比較本機混合 FP4/FP8 模型同 DeepSeek API 嘅準確度、工具呼叫成功率或者長 context 表現,亦冇量過雲端 API 每秒輸出幾多 token。作者所講嘅「幾乎一樣」,主要建基於本機毋須再用 2-bit 權重,加上幾日 agent 工作嘅主觀感受。呢個結果足以證明雙機版本順好多,未足以證明輸出質素同雲端完全一致,速度亦冇直接對照

仲有一點值得拆開:DeepSeek 雲端服務究竟用邊套 serving 設定、kernel 同 speculative decoding,外面睇唔晒。即使權重精度相近,sampling 設定、cache、系統 prompt 同推理框架都可以令答案有分別。真係要驗證質素,下一步應該用固定 prompt、固定 seed 同盲評,另外測長 context retrieval、寫 code 成功率同工具呼叫,淨係話「用落差唔多」太粗疏。

九千幾美元換取離線運作,成本遠高過 API

NVIDIA 美國官方店列出雙機連接套裝為 US$9,449。XDA 按 DeepSeek 8 月 16 日生效嘅新價,計到作者嗰三日 184.1M input token、1.38M output token 工作量,雲端 API 只需 US$3.79;照同一用量,要約 18 年先追得返硬件成本,仲未計折舊同維修。香港官方售價同供應情況暫時未有可靠資料,所以唔宜直接將美元換算當成港行成本。

功耗反而冇想像中誇張。XDA 用智能插座記錄 65 小時,兩部機合共用 6.33kWh;閒置拉 78W,持續推理平均 231W、峰值 272W。作者將 GPU 鎖到 2,000MHz 後,效能幾乎冇跌,持續功耗就少約 11%。問題係 68% 電費花喺閒置,想慳電就要做自動開關機,唔係擺兩部機長開。

自架真正合理嘅場景,係 code、合約、內部文件唔方便送上第三方 server,或者公司本身仲會微調模型。即使咁,XDA 用緊嘅兩個 container image 都由社群製作,vLLM 亦仲有跨 session prefix cache 問題;資料冇離開公司網絡,唔等於軟件供應鏈自然安全。對小型工作室嚟講,先量清楚每日輸出量、閒置時間同資料敏感度,再決定買機,會實際過追逐一個「本機等同雲端」嘅籠統講法。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook