M4 Max 本地 LLM 輸出快過 GB10,但長 prompt 同軟件生態要另計
3C 產品

M4 Max 本地 LLM 輸出快過 GB10,但長 prompt 同軟件生態要另計

圖片:via Tom's Hardware — https://www.tomshardware.com/desktops/exploring-apple-silicons-local-ai-performance-with-the-mac-studio-and-m4-max-m4-max-beats-gb10-and-strix-halo-in-decode-throughput-but-memory-bandwidth-isnt-everything
TechLab 編輯部(譯)·

同一套 llama.cpp 跑分,三部工作站各自贏喺唔同階段

Tom’s Hardware 拎咗一部配備 16 核心 CPU、40 核心 GPU 同 128GB 統一記憶體嘅 M4 Max Mac Studio,跟 Dell Pro Max GB10 同 AMD Ryzen AI Halo 比拼本地 AI。最搶眼嘅結果係 M4 Max 生成文字嗰段確實最快,不過一去到長 prompt、圖像生成同軟件兼容,優勢就倒返轉。TechLab 未有親自測試以下硬件,所有效能數字都來自 Tom’s Hardware。

呢輪跑分實際測咗咩

三部機全部用 llama.cpp 配合 llama-benchy,Mac 版由 source build,用 Metal 做後端。模型包括 MoE 架構嘅 Qwen 3.6-35B-A3B、dense 架構嘅 Gemma 4 12B-IT,同大型 MoE 模型 gpt-oss-120b,全部用 Unsloth Q4_K_M 4-bit 量化。每輪輸入 2,048 token、輸出 256 token,再把 context depth 由 0 推到 65,536,分開量度首個 token 延遲同持續輸出速度。呢套方法適合比較 llama.cpp 單一請求,冇測 MLX、TensorRT-LLM、批次處理或者多人同時連入。

銀色 Mac Studio 正面,機身前方有兩個 USB-C 插口同 SD 卡槽

圖片:Apple

M4 Max 點解生成得快

LLM decode 係逐個 token 順序生成,每生成一個 token,都要由記憶體讀取模型權重,所以記憶體頻寬好關鍵。高階 M4 Max 有 546GB/s,Tom’s Hardware 測試用嘅 GB10 同 Strix Halo 分別係 273GB/s 同 256GB/s。Qwen 測試喺零 context depth 時,Mac Studio 做到 77.83 token/s,GB10 係 62.7,Strix Halo 係 45.1;去到 65,536 context,三者分別跌至 56.67、42.2 同 35.5 token/s,M4 Max 全程領先。

不過頻寬多一倍,速度冇跟住多一倍。Tom’s Hardware 計出 M4 Max 跑 Qwen 只快 GB10 約 25%;換成 Gemma 4 12B,優勢就擴大到 1.8 倍,跑 gpt-oss-120b 則平均快約 1.5 倍。實際差距仲要睇模型係 dense 定 MoE、每步啟用幾多權重、運算核心同 runtime kernel。546GB/s 只能解釋方向,預測唔到某個模型實際會快幾多。

長文件入場,GB10 會快好多

Decode 快只代表模型開始答之後,文字出得爽快。模型正式開口前,仍要先消化 prompt、聊天記錄、程式碼或者 RAG 搵返嚟嘅文件。以 Gemma 4 12B、65,536 context depth 為例,Tom’s Hardware 量到 Mac Studio 首個 token 要等 225 秒,Strix Halo 要 235.5 秒,GB10 只要 47.8 秒。即係公司用幾萬 token 合約、codebase 或知識庫做查詢時,GB10 雖然逐字輸出慢啲,整次回應反而可能早好多完成。

固定工作量測試亦有同樣走勢:Tom’s Hardware 用 gpt-oss-120b,先處理 2,048-token prompt、context depth 設成 32,768,再生成 1,024 token。M4 Max 總能源效率好過 Strix Halo,不過 GB10 靠快好多嘅 prompt processing 最早完成,整項工作耗電亦最低。單睇電源火牛或者瞬時瓦數冇乜意思;做完同一份工作用了幾多時間同電量,先對長期開機成本有參考價值。

CUDA、模型格式同服務方式都會改變選擇

今次三部機用同一套 llama.cpp 同 Q4_K_M 模型,有助減少 runtime 差異,但公司現有系統未必行呢條路。llama.cpp 主要用 GGUF;Apple 另有 MLX-LM 同 MLX 格式,支援量化、微調同分散式推理;GB10 就有 CUDA、PyTorch、TensorRT-LLM、NIM、NGC container 同 NVIDIA Container Runtime。若團隊已有 CUDA workflow、要部署現成 container,GB10 慳返嘅整合時間可能值回機價。

兼容問題喺圖像生成測試已經現形。Tom’s Hardware 原先用 Flux.2 Klein 嘅 FP8 ComfyUI workflow,M4 Max 因 GPU 資料格式支援問題跑唔到,要改用 FP16;改完之後仍慢過 Radeon 8060S,GB10 就有明顯優勢。至於多個同事同時問模型、continuous batching、embedding、微調同長時間 server 負載,原文冇測,唔應該由單一使用者嘅 decode 跑分直接推算。

香港買機,Mac 價低但記憶體少一半

Apple 香港而家仍賣 M4 Max Mac Studio,不過已經冇 Tom’s Hardware 測試嗰個 128GB 選項。16 核心 CPU、40 核心 GPU 加 64GB 記憶體、512GB SSD 配置,Apple 網上配置器顯示約 HK$21,249;Mac 隨機有一年有限保養,AppleCare+ 可延長至三年。64GB 足夠跑唔少 30B 至 40B 級 4-bit 模型,但扣除 macOS、KV cache 同其他 app 之後,容量同 128GB GB10/Strix Halo 唔屬於同一級。

香港零售價亦反映呢個差距。豐澤列出 128GB、1TB 嘅 ASUS Ascent GX10 為 HK$43,999,要向供應商訂貨;格價網同期行貨報價約 HK$41,999 至 HK$43,999。GMKtec 香港列出 128GB、4TB 嘅 Ryzen AI Max+ 395 EVO-X3 為 HK$32,999,有兩年保養,不過查價時顯示售罄。價錢同存貨隨時會變,落單前仍要向店舖核實。

點揀先合理

工作主要係單人本地聊天、寫程式、整理私密文件,模型放得入 64GB,而且日常亦要用 macOS,M4 Max Mac Studio 生成快、CPU 強又夠靜,現價有吸引力。經常餵長文件、跑圖像模型、沿用 CUDA container,或者要畀幾個開發者同時用,GB10 會穩陣好多。Strix Halo 香港售價介乎兩者之間,亦有完整 Windows/x86 環境,不過今次 llama.cpp 效能同耗電都較弱,買之前最好先用自己真正會跑嘅模型試清楚。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook