
本機 LLM 真係慳錢又保密?16GB RAM 只夠入門,雲端模型仲未退場
由敏感文件摘要到 coding,拆清速度、成本同硬件限制
作者嗰套,唔算大眾電腦
XDA 作者用 Ollama 配 Open WebUI,喺 Windows PC 跑 DeepSeek-R1 14B、Llama 3.1 8B、Qwen2.5-Coder 7B 同 gpt-oss 20B。佢話本機模型慢慢取代咗大部分日常 AI 工作,包括文件摘要、整理 Obsidian 筆記、解釋程式碼同處理 Home Assistant 設定。但佢部機有 Core Ultra 9、RTX 5070 同 32GB RAM,呢個起點已經高過唔少上班族同自由工作者手上嗰部文書 notebook。

圖片:LM Studio
16GB RAM 跑得到,唔代表用得舒服
LM Studio 官方建議 Mac 同 Windows 最少有 16GB RAM;8GB Apple Silicon Mac 仍然可以跑,但只適合較細模型同較短 context。Windows 方面,官方亦建議有最少 4GB VRAM,而 x64 CPU 要支援 AVX2。以作者用嘅 DeepSeek-R1 14B 為例,Ollama 個量化模型檔已經有約 9GB,載入之後仲要預 RAM 畀 context、聊天介面同作業系統。16GB 係試玩起點,32GB 先較容易長開模型兼做其他工作;冇獨立 GPU 嘅 Windows 機可以靠 CPU 跑,不過回覆速度通常會慢好多。
私隱優勢係真,但部機本身都要守得住
Ollama 表明,本機運行時唔會收集、儲存或者傳送 prompt、回覆同模型互動;LM Studio 亦話,下載好模型之後,聊天同文件處理可以完全離線,內容會留喺裝置。對要處理公司合約、客戶資料、未公開報價或者內部程式碼嘅人,呢個優勢好實在。不過本機運行唔會自動令資料變安全:硬碟加密、使用者權限、備份位置同 Open WebUI 有冇開放俾同一個 LAN 入面嘅其他裝置存取,一樣要管好;公司文件亦要跟返僱主政策,唔係裝咗 Ollama 就可以任意餵入去。
文件摘要同筆記整理最啱用,研究就要識收手
本機模型最適合範圍清楚、容錯較高嘅工作,例如將一份長 manual 整成重點、按指定格式抽取發票資料、整理自己已有嘅研究筆記,或者解釋一小段程式碼。資料本身已經喺電腦入面,又唔使即時上網,細模型已經可以幫手慳時間。問題係模型照樣會睇錯表格、漏咗細節,甚至得出冇根據嘅結論,掃描 PDF 仲會受 OCR 質素影響。涉及法律、財務、醫療或者對外發佈嘅內容,原文同數字仍然要人手逐項核對。
速度快唔快,主要睇模型有冇塞得入 RAM 或 VRAM
本機模型冇網絡來回、排隊同訊息上限,細模型處理短 prompt 時可以好爽;但一去到長文件、大 context 或多個 coding agent 同時工作,RAM 用量同等候時間就會急升。模型塞唔入 VRAM,要改由 CPU 或系統 RAM 接手,體感可以由即問即答跌到逐隻字等。作者話本機版本快,應該理解成佢嗰套 RTX 5070 設定下嘅個人經驗,原文冇完整測試方法、token 速度或者雲端對照數字,唔適合推算到其他電腦。
冇月費,不等於冇成本
Ollama、Open WebUI 同唔少開放權重模型都可以免費用,但硬件、SSD 空間、耗電、風扇聲同散熱都係成本。作參考,中電 2026 年 7 月平均淨電價係每度電 144.7 仙,港燈公布嘅 2026 年平均淨電價就係每度 163.3 仙;實際支出要睇部機負載同使用時間,用插座電錶量度會準過估。日常只問幾次問題,為本機 LLM 特登買高階 GPU 未必划算;本身已有合適 Mac 或 gaming PC,又長期處理敏感資料,條數先較容易計得通。
複雜工作,雲端模型仍然穩陣啲
模型質素亦唔可以淨係睇參數量。OpenAI 話 gpt-oss 20B 可以喺 16GB RAM 裝置運行,常見 benchmark 表現接近 o3-mini,但呢個係官方測試結果,亦唔代表佢處理廣東話、長文件同你公司程式庫時一樣可靠。7B 至 20B 本機模型應付摘要、分類、改格式同短程式碼幾實用;要查最新網上資料、做複雜推理、處理大型 codebase,或者想少花時間揀量化版本同調設定,主流雲端模型通常仲係省事同穩定。
入門可以簡單啲
想試本機 LLM,Mac 或 Windows 用家可以先裝 LM Studio,揀一個 7B 至 8B 量化模型,再用自己平日真係會處理、但已刪走敏感內容嘅文件測試。想接駁 Obsidian、VS Code 或自建服務,先再考慮 Ollama 配 Open WebUI。測試時記低首個回覆要等幾耐、答案有幾多錯漏、RAM 峰值同風扇噪音,跟同一批問題嘅雲端結果對照。本機模型最啱接手大量細碎、重複同資料敏感嘅工作;要求最新資訊或高準確度時,直接轉用雲端會實際得多。
參考來源
- XDA Developers — I started self-hosting an LLM, and it became my favorite productivity tool — original report
- LM Studio System Requirements — 官方列出 Mac、Windows 嘅 RAM、CPU、VRAM 同系統要求
- LM Studio Offline Operation — 官方說明本機聊天、文件處理同離線功能點運作
- Ollama Privacy Policy — 核對本機 prompt、回覆同使用資料嘅處理方式
- Ollama DeepSeek-R1 Model Library — 核對 DeepSeek-R1 各版本嘅模型檔大小
- Introducing gpt-oss — 官方交代 gpt-oss 20B 嘅記憶體門檻同 benchmark 定位
- CLP Power Average Net Tariff, July 2026 — 核對中電 2026 年 7 月平均淨電價
- HK Electric 2026 Tariff Announcement — 核對港燈公布嘅 2026 年平均淨電價
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







