
玩 local LLM 一定要獨立顯示卡?RTX 5070 同舊 iGPU 差距拆解
XDA 同跑 Gemma 3 4B,Ryzen iGPU 慢得明顯,但日常工作仍然用到
XDA 今次用 LM Studio,喺兩部差好遠嘅 laptop 跑同一個 Gemma 3 4B。一部有 Core Ultra 9、32GB RAM 同 RTX 5070 Laptop GPU,另一部只得 Ryzen 7 5825U、integrated Radeon graphics 同 16GB RAM。結果冇推翻硬件常識:RTX 快好多,不過四年前嘅 Ryzen iGPU 又真係冇慢到完全做唔到嘢。對想試 local LLM 嘅人,呢個分別幾實際。
呢次比較其實測咗啲咩
XDA 作者用 LM Studio 0.4.20 同預設設定,兩邊都載入 Gemma 3 4B,再試摘要、改寫、問答、構思內容同寫簡單程式。附圖顯示 iGPU 嗰邊用嘅係 Q4_K_M 量化 GGUF,模型檔約 3.11GB,context 設做 8,192 token。呢啲資料好重要,因為 4B 量化模型本身就係偏輕量;今次結果唔代表 12B、27B,亦唔代表開盡 128K context 都會順。

圖片:NVIDIA
RTX 5070 快幾多?原文未做到完整 benchmark
XDA 文字只形容 RTX 幾乎即刻開始答,iGPU 就要等耐啲,冇交出統一 prompt、生成長度同多次測試平均值。附圖倒係見到,RTX 一次程式生成錄得 92.63 token/s,另一張 iGPU 邏輯題就係 5.96 token/s。兩張圖嘅 prompt 同輸出長度唔同,所以唔應該硬計成十五倍幾嘅正式差距;兩張圖唔足以計正式倍數,不過已睇得出體感差距:RTX 出字快好多,iGPU 每段答案就要等耐啲。

圖片:Google
iGPU 跑得郁,靠嘅係量化同共享 RAM
Ryzen 7 5825U 嘅 Radeon graphics 冇獨立 VRAM,XDA 畫面顯示系統劃咗 2GB 專用記憶體,另有最多 6.9GB shared GPU memory;載入模型後,16GB RAM 已用咗約 10GB。呢部機成功跑到 4B,關鍵係細模型壓到約 3GB,再借系統 RAM 補位。 RAM 頻寬同延遲遠追唔上 RTX 5070 嘅 GDDR7,所以生成慢係預期之內。16GB 可以入場,但想同時開瀏覽器、IDE、文件索引或者較長 context,32GB 會鬆動好多。
RTX 5070 Laptop GPU 有 8GB GDDR7,放一個 4B Q4 模型好充裕,亦可以將更多運算留喺 GPU。不過 8GB VRAM 都有上限:模型權重之外,context 越長,KV cache 食得越多;去到較大模型,軟件可能要將部分 layer 或 cache 放返 system RAM,速度跟住跌。買咗 RTX 5070 唔等於所有 local LLM 都可以全速跑,揀幾多參數、咩量化同 context 長度仍然要計記憶體。
答案質素接近,其實好合理
XDA 試摘要、改寫同邏輯題時,兩部機交出嘅內容大致接近。硬件主要改變生成速度,唔會令同一套 4B 權重忽然識多啲資料或者推理醒好多。就算兩次輸出有少少差異,都可能來自 sampling。換獨顯最直接改善係等候時間、長 prompt 處理速度同多工作負載能力;想要明顯高一級嘅答案,通常要換較大或較合適嘅模型,嗰時先會再撞上 VRAM 限制。
功耗差距未有實測數字
XDA 冇量插座耗電或者電量消耗,暫時唔可以話邊部機每次回答慳電啲。官方規格只畀到大概級數:AMD 將 Ryzen 7 5825U default TDP 列為 15W,NVIDIA 就將 RTX 5070 Laptop GPU subsystem power 列為 50 至 100W。前者係成粒 APU 嘅設計值,後者係獨顯功耗範圍,兩個數唔可以直接相除。RTX 食電高,但完成同一段輸出快好多;要比較每個答案實際用幾多電,仍然要有相同 prompt、相同 token 數同牆上功率計數據。
未買顯示卡,可以先點試
如果部機有 16GB RAM,可以先用 LM Studio 試 3B 或 4B Q4 模型;實際跑唔跑得順,仲要睇處理器、圖像 backend 同可用記憶體。偶爾整理私人文件、離線改文、寫摘要同簡單問答,等幾秒通常可以接受,而且 LM Studio 下載好模型後可以完全離線運行,資料唔使交上雲端。長時間用 AI 寫 code、跑 RAG、開長 context、同時服務幾個 app,獨立顯示卡先會明顯改善工作節奏。XDA 呢次測試最實用嘅結論好簡單:先喺現有電腦試細模型,再按實際速度同 RAM 用量決定使唔使升級。
參考來源
- XDA Developers — I run same local LLM on an RTX 5070 and integrated graphics, and the results were beyond my expectations — original report
- NVIDIA GeForce RTX 50 Series Laptop 規格 — 確認 RTX 5070 Laptop GPU 配備 8GB GDDR7,GPU subsystem power 為 50 至 100W。
- AMD Ryzen 7 5825U 官方規格 — 確認處理器架構、integrated Radeon graphics、記憶體支援同 15W default TDP。
- LM Studio 系統要求 — 確認 Windows 建議最少 16GB RAM、4GB dedicated VRAM,亦支援完全離線運行。
- Google Gemma 3 4B Q4_0 GGUF 模型頁 — Google 官方模型資料,交代 Gemma 3 4B 量化版本、context 能力同記憶體取捨。
- Google Gemma 3 model card — 確認 Gemma 3 模型大小、輸入類型、context 上限同官方定位。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







