
x86 NAS 跑 4B 本地 AI:5 tokens/s 慢成點,仲值唔值得用?
Ollama 加 Open WebUI 啱做短任務,8GB RAM 就幾勉強
XDA 作者 Jeff Butts 喺 UGREEN DXP4800 Pro 裝 Ollama,再用 Open WebUI 做介面,靠 CPU 跑 Qwen3 4B 同 Gemma 3 4B。結果的確出到答案,速度就只得每秒約 5.4 同 3.2 tokens。呢組數字只代表佢嗰部機、嗰兩個模型同當時嘅設定,換另一粒 CPU、量化版本、context 長度或者 prompt,表現可以差好遠。
5 tokens/s 實際要等幾耐
每秒 5.4 tokens,粗略計 300 tokens 嘅短答覆都要接近一分鐘,仲未計載入模型、讀 prompt 同模型「諗緊」嗰段時間。XDA 個案入面,Qwen 分析一份刻意整壞咗設定嘅 Pi-hole log,跑咗超過 17 分鐘仍然搵錯方向;Gemma 3 4B 用 4 分 13 秒搵到真正問題,但之後亦補咗啲作者唔敢直接信嘅建議。速度慢尚且可以等,但如果結果唔可靠,就唔適合用嚟處理 server 故障或者備份問題。,尤其你等緊佢救 server 或者判斷備份有冇出事。
相反,資料同目標都寫得清楚嘅工作就合理好多。XDA 畀模型整理一批 Jellyfin Docker 筆記,模型保留咗 port、路徑、mount 同設定,再執成 Markdown,全程約 1 分 50 秒。用嚟摘要私人文件、清理會議筆記、統一格式、替文字分類,等一兩分鐘通常接受到。叫 4B 模型做深入研究、長篇寫作、複雜除錯或者大量互動問答,就會好易磨走耐性。
8GB RAM 跑到,但冇乜鬆動位
DXP4800 Pro 配 Intel Core i3-1315U,XDA 測試嗰部只有約 7.7GB 可用 RAM。Qwen 工作時,Ollama 約用 3.1GB 記憶體,系統可用 RAM 一度跌到約 409MB,swap 升到約 5GB。官方 Ollama 模型庫列出預設 Qwen3 4B Q4_K_M 檔案約 2.5GB,Gemma 3 4B Q4_K_M 約 3.3GB;模型檔案大小唔等於完整運行用量,context、快取、Open WebUI、NAS 系統同其他 container 都會繼續食 RAM。
所以 8GB 可以當試玩起點,長開就相當勉強。NAS 仲要行檔案服務、相片索引、影音轉碼、備份或者其他 Docker app,swap 一忙,硬碟反應同整體延遲都可能受拖累。16GB 會實際好多,但都要預留空間畀 NAS 原本工作;想靠加 RAM 令生成速度突然大升亦唔現實,加 RAM 主要係避免模型同其他服務爭記憶體;生成速度就主要受 CPU 表現影響。。
一般 x86 NAS 點判斷玩唔玩得
先睇部 NAS 有冇 x86-64 CPU、可唔可以行 Docker 或其他 container,同 RAM 可唔可以擴充。Open WebUI 官方有 CPU-only 一體化 container,安裝門檻唔算高;入門可以先拉一個 4B、Q4 級量化模型,用一段真實筆記試摘要同格式整理,再觀察 CPU、RAM、swap、溫度同檔案傳輸有冇明顯跌速。測試時亦要固定模型 tag、context 同 prompt,否則單憑「4B」三個字比較速度冇乜意思。
私隱、電費同維護點取捨
本地跑最大吸引力係私人文件可以留喺屋企內聯網,屋企本身長開 NAS,亦唔使再擺多一部主機,對空間有限嘅環境幾合理。不過私隱優勢有前提:Open WebUI 冇接外部模型、搜尋或工具,container 同帳戶亦要管好。官方文件建議將 Open WebUI 放喺可信任嘅內聯網入面;想出街連返屋企,用 VPN 或有認證嘅 reverse proxy,唔好直接將 WebUI 或 Ollama port 開上網。
成本亦唔可以只睇「每個 token 免費」。CPU 長時間高負載會加耗電、熱量同風扇聲,仲會搶走 NAS 原本工作嘅資源;實際電費要用智能插座量度空閒同生成時嘅功耗差,再按自己使用時間計。軟件方面,Ollama、Open WebUI、模型同 container image 都要更新兼備份設定。每日只整理幾段敏感文字,呢份維護可能值得;追求即問即答、複雜推理或者多人共用,雲端模型會省心得多。
XDA 呢次測試大致反映到 CPU-only NAS 適合處理邊類工作:短、清楚、有齊資料、容許遲少少完成嘅任務值得試,牽涉複雜判斷就唔好靠佢頂住。手上已有可加 RAM 嘅 x86 NAS,可以先裝一個 4B Q4 模型試自己最常做嗰兩三項工作;如果未買 NAS,單為本地 AI 揀機就應該直接考慮有合適 GPU、較大記憶體頻寬嘅硬件。
參考來源
- XDA Developers — I'm running AI on my NAS at 5 tokens per second, and it's surprisingly useful — original report
- UGREEN NASync DXP4800 Pro Quick Start Guide — 核對 DXP4800 Pro 嘅 Intel Core i3-1315U、記憶體容量同基本硬件規格。
- Ollama:qwen3:4b — 核對預設 4B 模型嘅參數量、Q4_K_M 量化同約 2.5GB 檔案大小。
- Ollama:gemma3:4b — 核對 Gemma 3 4B 嘅 Q4_K_M 量化、約 3.3GB 檔案大小同多模態定位。
- Open WebUI Quick Start — 核對 Docker、CPU-only 一體化 container 同連接 Ollama 嘅官方做法。
- Open WebUI Hardening Guide — 參考私人網絡、VPN、reverse proxy、認證、HTTPS 同存取控制建議。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







