二手 Tesla V100 變本地 LLM 神卡?32GB VRAM 平價背後有幾多伏
3C 產品

二手 Tesla V100 變本地 LLM 神卡?32GB VRAM 平價背後有幾多伏

圖片:via XDA Developers — https://www.xda-developers.com/a-used-tesla-v100-has-quietly-become-the-cheapest-way-to-run-local-llms-at-home/
TechLab 編輯部(譯)·

容量夠吸引,不過散熱、軟件壽命同改裝成本要計清楚

點解 V100 突然抵玩

Tesla V100 本來係 2017 年嗰代 data center GPU,而家大批退役貨流入二手市場,先有今次「平價 32GB CUDA 卡」呢個機會。XDA 7 月底見到嘅 32GB PCIe 版本低價約 US$400 至 US$500,有退貨保障嘅美國翻新貨就接近 US$880;同期二手 RTX 3090 約 US$700 至 US$1,050。呢啲只係海外掛牌價快照,運費、稅項、退貨成本同貨況都未計,唔可以直接當香港到手價。

NVIDIA Tesla V100 PCIe 雙槽 data center GPU

圖片:NVIDIA

16GB 同 32GB,買錯版本差好遠

PCIe V100 16GB 同 32GB 都用 GV100,官方規格包括 5,120 個 CUDA core、900GB/s HBM2 頻寬同 250W 功耗上限。真正吸引係 32GB 容量:佢多 RTX 3090 8GB,模型、量化權重同 KV cache 較易一齊留喺 VRAM,跑 30B 級模型或者較長 context 時鬆動好多。16GB 版本雖然平,容量仲少過 RTX 3090,買佢主要係想加一張獨立推理卡,唔係突破模型大小上限。

NVIDIA Tesla V100 SXM2 NVLink 模組

圖片:NVIDIA

頻寬接近 3090,速度就唔代表打和

V100 嘅 900GB/s HBM2 同 RTX 3090 嘅 GDDR6X 頻寬好接近,但 token 速度仲會睇模型格式、量化 kernel、prompt 長度同軟件版本。RTX 3090 用嘅 Ampere 架構新過 V100,整體運算力同新 kernel 支援通常都佔優;V100 就靠高頻寬維持實用嘅生成速度。XDA 今次冇做兩卡同環境對比,網上零散跑分亦差距極大,買 V100 應該係睇中 32GB 容量同價差,唔好預佢有 RTX 3090 級嘅全面速度。

Ollama 仲用到,vLLM 已經響起警號

Ollama 而家嘅官方硬件表仍然列明支援 compute capability 7.0 嘅 V100,固定一套可用版本,日常跑 GGUF 模型未算難搞。不過其他工具已經收窄:vLLM 嘅 V1 engine 唔支援 compute capability 8.0 以下,而舊 V0 engine 連同 V100 支援亦已移除。XDA 指 LM Studio 嘅 CUDA runtime 同部分 llama.cpp 預編譯檔同樣唔再包 Volta,遇上呢類情況就要鎖舊版或者自己編譯。

CUDA 12.6 會變成長期包袱

NVIDIA 喺 CUDA 13 移除 Maxwell、Pascal 同 Volta 嘅離線編譯及 library 支援,新 toolkit 已經唔可以再以 V100 做目標。PyTorch 2.12 仍保留 CUDA 12.6 legacy build 照顧 Volta,但主線已經轉去 CUDA 13。即係今日砌好嘅環境可以繼續用,之後升 PyTorch、driver、模型 loader 或推理框架,都可能要逐個版本對。V100 亦冇 BF16 同 FP8,愈來愈多新模型優化未必輪到佢。

PCIe 同 SXM2 唔可以撈亂買

PCIe V100 係雙槽卡,可以插一般 PCIe x16 槽,但原裝用被動式散熱,靠 server 前後強風帶走熱力,普通 ATX 機箱幾把慢速風扇頂唔住。通常要另加風罩、高風壓風扇同合適供電轉接線,而且張卡冇 HDMI 或 DisplayPort,要靠內置顯示或者另一張顯示卡出畫面。SXM2 版本係 300W 模組,仲要專用轉接板、散熱器同供電,改裝難度同風險再高一級。

噪音同電費,細單位特別難忽略

Tom’s Hardware 報道過一套 SXM2 改裝,原裝鼓風機量到 82dB;呢個只係該套裝置嘅數字,唔代表所有 V100,但足以說明 server 散熱方案有幾進取。按中電 2026 年每度電平均淨電價 HK$1.406 粗略計,250W PCIe 卡若全月 24 小時頂住功耗上限,單計 GPU 已約 HK$253,未包 CPU、風扇同火牛損耗。實際推理未必長期滿載,不過熱風同噪音會直接留喺房內。

其他舊 server 卡又點揀

Tesla P40 有 24GB,但同樣係 250W 被動散熱,而且 Pascal 亦已俾 CUDA 13 淘汰;P100 得 12GB 或 16GB,容量優勢有限。T4 只食 70W、軟件壽命亦好過 Volta,不過得 16GB。AMD Instinct MI50 有 32GB HBM2,規格幾吸引,但 ROCm、模型格式同工具相容性要另外處理。V100 32GB 之所以突出,靠嘅係 32GB、CUDA 同二手價三樣嘢剛好撞埋一齊,唔代表其他舊卡全部冇得揀。

邊類人先值得買

如果搵到明顯平過二手 RTX 3090 嘅 PCIe 32GB 貨,賣家又肯提供型號、壓力測試、溫度同 ECC error 記錄,加上你識鎖 CUDA/PyTorch 版本、改散熱同處理退貨,V100 仍然幾抵玩。價差縮到只剩一兩成,就揀 RTX 3090 省事得多,仲有顯示輸出、成熟主動散熱同較長軟件壽命。一般用家想插卡即跑 Ollama,V100 呢條路會花太多時間喺張卡以外嘅地方。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook