
二手 Tesla V100 平價加 16GB VRAM:本機 LLM 慳錢背後六個伏位
RTX 4080 加舊企業卡跑 27B 模型,硬件同軟件都要逐樣執
Oscar Molnar 五月底分享咗一套幾硬核嘅本機 AI 配置:保留 RTX 4080 16GB,再加一張二手 Tesla V100 SXM2 16GB,用約 £200 買卡同轉接板,最後跑到 27B 模型約 32 tokens/s。Tom’s Hardware 到七月底先再報道,所以呢件事已經流傳近兩個月;呢個個案最值得睇嘅,係平價大 VRAM 背後其實要付出幾多手作成本。
平價 16GB HBM2,先要解決插唔落 PCIe
V100 係 2017 年 Volta 架構企業 GPU,Molnar 嗰張 SXM2 版有 16GB HBM2、900GB/s 記憶體頻寬。規格放到而家跑 LLM 仍然有用,不過 SXM2 本身係畀 DGX 同企業 server 用,冇普通 PCIe 金手指、顯示輸出同常見顯示卡供電接口。佢要另買約 £50 嘅非官方 SXM2-to-PCIe 轉接板,成套先可以裝落桌面電腦。
呢類轉接板多數由第三方生產,供電設計、焊接質素、散熱器接觸面同售後差異可以好大。Nvidia 官方資料列出 V100 SXM2 最大功耗為 300W,就算 Molnar 話自己嗰張跑 LLM 時最高只見約 150W,火牛、電線同轉接板仍然要留足餘量。改風扇線路、用 jumper wire 試 pin 腳亦有短路或整壞硬件風險,未熟供電規格就唔適合照跟。

圖片:Nvidia
82dB 放喺睡房,平都冇用
Molnar 用 Apple Watch 量到轉接板跟來嘅風扇有 82dB,形容聲量介乎廚餘機同割草機。原因好簡單:V100 SXM2 原本靠 2U server 高風壓散熱,搬入普通機箱後,第三方方案直接叫細風扇長行 100%。佢最後將轉速訊號同 PWM 控制接去主機板,固定約 10%,聲量先回復可接受水平;按佢個案所講,滿載溫度亦維持喺 50°C 以下。
呢組溫度同噪音只代表佢嗰塊轉接板、散熱器、機箱風道同室溫,換另一個賣家已經可以完全唔同。香港細單位通常電腦同人距離近,150W GPU 加 RTX 4080 同整部主機排出嘅熱亦會留喺房內。風扇改靜後仍要睇 hotspot、HBM 溫度同長時間負載穩定性,淨係見到核心得 50°C,重未足以判斷成套散熱靠唔可靠。
32GB 係分拆容量,程式要識得調度
呢部機所講嘅 32GB VRAM,係 RTX 4080 16GB 加 V100 16GB 嘅合計,唔等於有一個統一 32GB 記憶體池。兩張卡分屬 Ada 同 Volta 架構,資料亦要經 PCIe 傳送;一般遊戲、繪圖軟件或者只支援單 GPU 嘅 AI 工具,唔會自動當佢係一張 32GB 顯示卡。模型能夠放得落,全靠 llama.cpp 將權重同 KV cache 分配去兩張卡。
Molnar 公開嘅設定用 -ngl 99 將所有層放上 GPU、128k context、單一平行工作,再用 -ts 1.0,1.0 平均分配。值得留意,佢冇加 --split-mode;llama.cpp 而家文件列明預設係按層 pipeline,-ts 只控制分配比例。換模型、llama.cpp 版本、context 長度或多用家平行工作後,記憶體佔用同速度都會變,32GB 呢個數唔可以套落其他軟件。
32 tokens/s 係一個配置嘅成績
原作者跑嘅係約 19GB、Q5_K_M 量化嘅 Qwen3.6-27B-MTP,報稱生成速度約 32 tokens/s,prompt 處理約 133 至 160 tokens/s,128k context 同視覺 projector 亦可裝入兩張卡。互動速度的確夠爽,不過佢冇提供多組 prompt、實際 context 佔用、重複測試誤差同全機插牆功耗,亦冇喺相同條件下對比單卡方案,呢個成績只應視為成功個案。
「快過多數雲端 API」亦係原作者判斷,網絡延遲、雲端模型大小、服務負載同輸出設定都會影響結果。本機 LLM 真正吸引之處係資料可以留喺自己部機,冇逐 token 收費,斷網亦用到;至於模型質素、維護時間同整體成本,就要按自己工作量計,單靠 32 tokens/s 未足以判斷值唔值得轉用。
Driver 冇原文講到咁絕,但配置仍然麻煩
Molnar 用 NixOS、legacy 535 driver、CUDA 12.2 同 Linux kernel 6.6,重開咗 X server 服務先正常載入 Nvidia module。佢話 560 branch 起已放棄 Volta,呢句同 Nvidia 官方 R560 release notes 有出入:官方仍有列 Tesla V100,同時表明 R560 起預設用 open kernel module,而呢套 module 只支援 Turing 或更新架構;Volta 要揀 proprietary module。
即係 V100 未喺 560 立即消失,不過 Ada、Volta、CUDA、kernel 同發行版套件要搵到共同組合,維護難度確實高。Molnar 部機暖重啟後有時連 lspci 都搵唔到 V100,要完全熄機再開先回復;模型又大過任何一張卡,少咗 V100 後 llama.cpp 會不停啟動失敗。打算長開做私人 AI server,呢種異常會直接影響可靠度。
香港入手價要連轉接板同風險一齊計
eBay 香港站嘅 V100 SXM2 16GB、PCIe 轉接板同運費價格會隨刊登、目的地同庫存波動,退貨安排同買家保障亦可能唔同,落單前要用實際香港地址逐項確認。
電費反而未算最大筆。按原作者觀察到嘅 V100 約 150W,假設每日滿載四個鐘,每月約用 18kWh;套用政府公布嘅 2026 平均淨電價,單計呢張卡大約係 HK$25 至 HK$29,未包 RTX 4080、CPU 同散熱。長時間滿載、夏天開冷氣或者實際功耗貼近官方上限,數字自然再升。呢套玩法適合享受執 Linux、改散熱同排錯嘅玩家;只想穩定開機即用,平價 V100 好容易變成一個長期維修項目。
參考來源
- Tom's Hardware — AI enthusiast adds Nvidia Tesla V100 as loud as a lawnmower to gaming PC for $266 — 32GB of VRAM rig can run 27 billion parameter model at 32 tokens per second — original report
- Oscar Molnar:I Put a Datacenter GPU in My Gaming PC for £200 — 原作者完整紀錄,包含硬件、噪音、功耗、模型設定、速度同重啟異常
- Oscar Molnar 公開 NixOS/llama.cpp 配置 — 核對 driver、CUDA、kernel、context、GPU layers 同 tensor split 參數
- Nvidia Tesla V100 官方資料表 — 核對 V100 SXM2 記憶體、頻寬、介面同最大功耗
- Nvidia R560 Data Center Driver Release Notes — 確認 R560 仍有列出 Volta 同 Tesla V100 支援
- Nvidia Driver Installation Guide:Kernel Modules — 確認 Volta 唔支援 open kernel module,要用 proprietary module
- llama.cpp:Multi-GPU 文件 — 解釋多 GPU layer split、記憶體分配、PCIe 瓶頸同限制
- 香港政府:2026 年電費調整 — 核對中電同港燈 2026 平均淨電價,估算額外用電成本
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







