
16GB RAM 輕薄 notebook 跑本機 LLM:四個模型做到咩、卡喺邊
XDA 用 Ryzen 7 5000 系列試跑,細模型夠用但數據仲未算完整
XDA 作者 Yash Patel 用 Lenovo IdeaPad Slim 3 試跑四個本機 LLM,規格係 AMD Ryzen 7 5000 系列處理器、16GB RAM、512GB SSD 同 Radeon 整合顯示核心。佢用 KoboldCpp 載入 GGUF 模型,幾星期內試咗寫作、coding、推理同日常工作,最後認為 3B 至 7B 係呢類普通 notebook 較實際嘅範圍。TechLab 未有喺同類平台實測,以下效能描述全部來自 XDA 作者。
四個模型,其實食幾多位
XDA 揀中嘅四個模型用途幾分明。模型檔案大小係按對應 GGUF 版本資料整理,原文冇列出下載容量;實際載入之後仲要預留 context、KV cache 同運算 buffer,所以檔案大小唔等於總 RAM 用量。
| 模型 | XDA 作者使用版本 | 模型檔案約數 | 作者主要用途 |
|---|---|---|---|
| Mistral 7B | Q8_0 | 7.7GB | 構思題材、文章大綱 |
| Phi-4 Mini 3.8B | Q6_K | 待確認 | 改寫、短摘要、簡單解釋 |
| Gemma 3 4B | Q4_K_M | 待確認 | 拆問題、比較選項 |
| Qwen3.5 4B | Q8_K_XL | 待確認 | 寫細段程式、解錯、改 code |
Q4、Q6、Q8 係唔同量化級別;一般嚟講,數字愈高,模型檔愈大,量化造成嘅品質損失通常亦愈少。Gemma 3 4B Q4 嘅模型檔大小仍然有待確認,未可以判斷畀系統同 context 留低幾多空間。Mistral 7B Q8 就去到 7.7GB,放入 16GB 電腦仍然有機會跑,不過可用餘量細好多。

圖片:Google
「跑得好」仲欠一組關鍵數字
原文最大缺口係 冇 token/s、首個 token 等候時間、context 長度、GPU offload 層數、統一 prompt 同功耗數據。作者只形容 Mistral 回應要等一陣,Qwen 生成較長程式亦會慢,呢啲屬使用感受,未算可重現 benchmark。就連處理器都只寫「Ryzen 7 5000 Series」,冇交代確實型號、RAM 速度、單/雙通道、驅動版本或者用 Vulkan 定其他 backend,換另一部機已經可能有幾大差距。
呢點對整合顯示核心尤其重要。Radeon iGPU 同 CPU 共用系統 RAM,16GB 唔會憑空多出一份獨立 VRAM;Windows、瀏覽器、模型權重、KV cache 同運算 buffer 全部喺同一個池攞位。context 開得愈長,記憶體壓力愈大,一旦開始大量用 SSD pagefile,互動速度通常會明顯跌。RAM 頻寬同通道配置亦會影響推理,所以淨係睇「16GB+Radeon」未夠判斷部機快唔快。

圖片:Mistral AI
安裝容易咗,調校門檻仍然喺度
KoboldCpp 已經將入門步驟壓得幾簡單,Windows 可以下載執行檔、揀 GGUF 模型,再開本機介面。官方對 AMD 硬件建議先試 nocuda 版本嘅 Vulkan backend,亦提供 autofit、GPU layers 同 context size 設定。不過揀錯量化版本、context 開得太大,或者 Vulkan 驅動配合得唔好,一樣會遇到載入失敗、跌返 CPU 跑或者速度忽快忽慢。對第一次玩本機 LLM 嘅人,先由 4B Q4、細 context 開始會穩陣過直接塞 7B Q8。
離線私隱就係呢套玩法最實際嘅賣點。模型同推理介面完全留喺電腦,而且冇開 remote tunnel、網上搜尋或第三方整合時,prompt 同文件可以唔上雲,處理會議紀錄、未公開草稿同 code 都安心啲。代價係模型要自己下載、更新同管理,答案亦冇雲端服務嘅即時資料;涉及重要決定或者敏感文件,照樣要人手核對輸出。
識中文,未代表識香港廣東話
四個模型當中,Qwen3.5 官方列有多語言評測,Gemma 3 話支援逾 140 種語言,Phi-4 Mini 亦將中文列入支援語言。不過「Chinese」標籤只證明模型接觸過中文,唔代表繁中用字自然,仲唔代表處理到香港廣東話語法同文化背景。XDA 今次冇測廣東話或者繁中 prompt,而 HKCanto-Eval 呢類研究正正反映廣東話要獨立評估,唔可以由普通中文 benchmark 直接推斷。
如果用途係英文摘要、簡單腦震盪或者細型 coding,XDA 呢次已經證明舊款 16GB notebook 有試玩空間。要處理廣東話逐字稿、香港用語或者長篇繁中文件,就應該先準備一批自己熟悉嘅 prompt,比較錯字、語氣、事實同速度。已經有 16GB 電腦嘅人可以由 4B Q4 試起;如果正打算長期跑本機模型,32GB RAM 同較高記憶體頻寬會實際得多,亦可以留返更多餘量。
參考來源
- XDA Developers — These 4 self-hosted LLMs run surprisingly well on integrated graphics — original report
- KoboldCpp 官方 Wiki — 核對 AMD Vulkan、GPU layer offload、context size 同 RAM/VRAM 要求。
- llama.cpp Quantization 文件 — 解釋量化點樣影響模型大小、記憶體需求同推理表現。
- Mistral 7B Instruct v0.3 GGUF 檔案頁 — 核對 XDA 所用 Q8_0 模型檔案約 7.7GB。
- Gemma 3 4B 官方 Model Card — 核對模型規模、語言支援、context 能力同官方用途說明。
- Phi-4 Mini Instruct 官方 Model Card — 核對 3.8B 參數、支援語言同模型限制。
- Qwen3.5 4B 官方 Model Card — 核對模型版本同官方多語言、coding 評測資料。
- HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding — 補充廣東話理解同香港文化背景要獨立測試,唔應由一般中文能力直接推斷。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







