本地 AI 選 RTX 3090?24GB VRAM 對 16GB RTX 50 的取捨
3C 產品

本地 AI 選 RTX 3090?24GB VRAM 對 16GB RTX 50 的取捨

圖片:TechLab 自製資訊圖
TechLab 編輯部(譯)·

二手 RTX 3090 因為配備 24GB VRAM,正重新成為本地 AI 用家的討論焦點。XDA Developers 作者 Ty Sherback 認為,即使二手卡報價已升至約 1,000 美元或以上,若目標是以 Ollama、llama.cpp 等工具在自己電腦運行較大型語言模型,這張舊卡仍有吸引力。其核心理由很直接:現行部分 RTX 50 系列顯示卡雖有較新架構,卻只有 16GB VRAM;對本地推論而言,容量不足往往比運算速度落後更早構成限制。

不過,這並不等於 RTX 3090 是人人應買的答案。這是原作者的選購觀點,並非一項由 TechLab 進行的實測結論。RTX 3090 已沒有新卡供應,二手卡不附保養,而且過往可能先後用於遊戲、挖礦及 AI 工作;原文更提醒,顯示記憶體長期高溫運作後,散熱墊或有更換需要。準買家要衡量的,是以二手硬件風險換取較大 VRAM,而不是只把它當成「平價升級」。

VRAM 決定模型能否舒適運行

本地大語言模型的瓶頸,很多時候首先是記憶體容量。原文指出,Ollama 和 llama.cpp 會盡量把模型層載入 VRAM;當顯示卡放不下,餘下部分便要改由 CPU 配合系統 RAM 處理。這種分工可以讓模型勉強啟動,卻會令生成速度明顯下降。因此,用家不應只看 GPU 的峰值算力,也要先問:自己常用的模型、量化格式及預留的 context,是否能完整或近乎完整留在顯示記憶體內。

按原文的估算,27B 至 32B 級模型即使採用 4-bit quantization,模型本體已約需 17GB 至 20GB VRAM,尚未計入 context 所需空間。這正好解釋 16GB 與 24GB 之間的實際分野:16GB 卡可以運行不少較小或經量化的模型,但面對上述級別便容易需要 offload;24GB 的 RTX 3090 則可容納這類模型,並有較大的緩衝空間。這個差距對只想測試本地聊天模型的人未必關鍵,對希望長時間使用較大模型的開發者則很實在。

同一邏輯亦延伸至圖像、影片生成與 fine-tuning。原文提到,較大型 diffusion 模型的全精度版本可超出 16GB,容量較小的卡需要依賴量化版本,或把 pipeline 一部分轉往系統 RAM;而 fine-tuning 還要同時容納模型、gradient 和 optimizer state,對 VRAM 的要求更高。可作出的合理推論是,16GB 新卡在「放得下」的工作上可能較快或較省電,但遇上容量門檻時,較高速度不能彌補模型無法順暢載入的問題。

新卡的效率,對上舊卡的容量

原文以作者當時所見的海外市場作比較:最低價的 RTX 5070 Ti 約為 1,120 美元,具 16GB VRAM;RTX 5080 約 1,600 美元,同為 16GB;具備超過 24GB VRAM 的現行 GeForce RTX 5090 則至少約 5,000 美元。同期已成交的二手 RTX 3090 約由 1,000 美元起,較早前則曾處於約 600 至 800 美元區間。這些只是原文寫作時的海外報價與成交觀察,不能直接視為香港市價、貨源或保養條件。

以這個價格結構來看,RTX 3090 的吸引力並非「舊卡比新卡快」,而是以接近部分新 16GB 卡的預算,取得多 8GB VRAM。對於模型規模剛好跨過 16GB 上限的人,這 8GB 可改變工作流程:由頻繁 CPU offload,轉為更多模型層留在 GPU。相反,若日常只用可安穩置入 16GB 的模型,新卡的保養、效率及較低的使用顧慮,本身已有相當價值。選購時應先列出實際模型需求,再決定容量溢價是否值得,咁樣會比單看型號年代更準確。

替代方案的代價不只在價格

XDA 亦列出兩個 24GB 替代選項:Intel Arc Pro B60 曾以約 650 美元新卡售出,附保養,功耗額定為 200W;AMD RX 7900 XTX 當時可見約 700 至 900 美元。原作者認為,Arc Pro B60 的記憶體頻寬為 456GB/s,少於 RTX 3090 的一半,而頻寬會影響 token 生成速度;它亦採用較少項目支援的 Intel 軟件堆疊。至於 RX 7900 XTX,原文視之為在 Linux 上經 ROCm 運行 LLM 的可信選項,但需要接受另一套軟件環境。

這些比較顯示,本地 AI 的硬件取捨至少包含四層:VRAM 容量決定可裝載的模型範圍,頻寬影響生成節奏,軟件生態影響工具是否容易使用,而保養及硬件狀態決定長期成本。原作者偏向 CUDA 的即插即用支援,因而願意承受 RTX 3090 的二手風險;但這不代表其他平台不能完成工作。已熟悉 Linux、ROCm 或特定 Intel 工具鏈的用家,對同一張卡的評價可以很不同。

下手前應把「可運行」和「可長用」分開看

若考慮二手 RTX 3090,較務實的判斷順序是:先確定目標模型是否確實會受 16GB 限制,再比較當地實際售價、退貨保障、保養狀態和卡況,最後才衡量速度與效率。原文作者提及 eBay 的「貨不對辦」退款保障,並表示自己曾依賴該保障完成退款;這只是其個人經驗,亦不等同其他交易平台或地區的保障安排。任何二手交易都應仔細閱讀刊登內容,不能把平台名稱當成硬件品質保證。

接下來值得留意的,是新一代消費級顯示卡會否把較大 VRAM 帶到較可負擔的價位,以及本地 AI 工具對不同 GPU 軟件堆疊的支援會否擴闊。在此之前,對於確實需要運行 27B 至 32B 級 4-bit 模型、又重視 CUDA 相容性的用家,24GB RTX 3090 仍是一個有明確理由的選項;對模型需求較小或看重保養與效率的人,16GB 新卡同樣可能是更穩妥的取捨。

延伸閱讀

AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook