
普通電腦自己跑 LLM 值唔值?私隱同成本背後仲有幾筆數
Ollama、LM Studio 嘅安裝門檻、硬件限制同私隱設定
XDA 作者 Raghav Sethi 用一部 M1 MacBook Air、16GB unified memory,經 Ollama 跑 DeepSeek-R1 7B,再加 Open WebUI 做聊天介面。佢話簡單改 code、起草同離線工作都夠用,亦冇訂閱費。不過呢個體驗最值得睇嘅地方,係今日普通電腦確實跑得郁小型 LLM;至於可唔可以頂替 ChatGPT,答案仍然好視乎工作種類。
16GB RAM 係較穩陣嘅起步點
作者用嗰個 DeepSeek-R1 7B,其實係 7.62B 參數嘅 Q4_K_M 量化版本,Ollama 顯示模型檔案約 4.7GB。但硬碟放得落,唔代表得 4.7GB RAM 就夠,模型載入後仲有 context cache、系統同其他 app 爭記憶體。LM Studio 官方建議 Mac 同 Windows 最少準備 16GB RAM,Windows 獨立顯示卡就建議有 4GB VRAM;8GB Mac 仍可試細模型,但 context 唔可以開得太進取。
Apple Silicon 嘅 CPU 同 GPU 共用記憶體,裝好 app、揀模型再載入已經可以開始。Windows 情況較碎,模型有機會一部分放 VRAM、一部分放 RAM,速度亦會受顯示卡、記憶體頻寬同量化版本影響。XDA 原文冇提供 token/s 或耗電數字,只話單獨跑 7B 尚算順,一邊開其他工作就會慢,所以唔應該將呢部 M1 Air 嘅主觀感受當成所有 16GB 電腦嘅保證。
Ollama 易自動化,LM Studio 易上手
Ollama 適合肯用 command line、想接 editor 或自建工具嗰班人,下載模型、啟動本機 API 同睇 CPU/GPU 分配都有現成指令。LM Studio 就有圖像介面,搜尋、下載同切換 GGUF 模型都方便直接,仲可以將 PDF 等文件留喺機內做摘要或問答。安裝本身已經唔算難,較花時間反而係試模型:同樣寫住 7B,訓練資料、prompt 格式、量化精度同 context 長度都會左右答案。
對模型質素亦唔好預期太高。XDA 作者用 7B 模型處理簡單 code 尚算滿意,但問第一代 iPhone 時,模型竟然答 1986 年。呢類細模型可以幫手整理內部會議筆記、歸納合約段落、改寫電郵或先掃一次程式碼,涉及最新資料、複雜推理同關鍵事實就要再查。雲端模型仲有搜尋、較大 context、圖片處理同持續更新,功能差距唔會因為本機模型成功開到就消失。
本機運算都要逐項關好私隱
Ollama 官方話,純本機模型嘅 prompt 同答案唔會交返畀 Ollama;不過新版亦有雲端模型同網上搜尋,要設定 disable_ollama_cloud 或 OLLAMA_NO_CLOUD=1,先可以明確鎖成 local-only。LM Studio 下載好模型後,聊天、文件處理同 localhost server 都可離線,但搜尋及下載模型、取得 runtime、檢查更新仍會連網。即係公司文件可留喺電腦處理,但模型來源、更新流量同第三方外掛仍要管。
資料留喺本機亦代表責任落返自己度。聊天記錄、模型、文件索引同 server log 都會佔用硬碟,電腦備份、磁碟加密、帳戶權限同惡意軟件同樣要顧。Ollama 預設只綁 127.0.0.1;LM Studio 亦提醒,只要改成 0.0.0.0 供其他裝置連入,就應開認證。XDA 作者用 Open WebUI、Ngrok 同基本登入做遙距存取,呢套組合多咗幾個要更新同保護嘅環節,唔適合裝完就長期唔理。
慳訂閱費之前,先計硬件同時間
Ollama、LM Studio 同唔少模型都可以免費用,DeepSeek-R1 7B 呢個版本亦列明 MIT License。不過仲要計 SSD 空間、下載時間、電費、維護成本,同埋跑模型拖慢部電腦造成嘅影響。未量度整部機喺自己工作量下嘅功耗,冇辦法負責任咁寫每月慳到幾多;如果手上已有 16GB 電腦,只係間中摘要文件,額外電費通常較易接受。若果要特登買高階 GPU,只為避開一個月費,條數未必合理。
ChatGPT 本身有免費層,付費方案買到較高用量、較強模型、搜尋同其他整合,但仍設使用限制。個人帳戶亦可以關掉用對話改善模型;Business、Enterprise 同 API 就預設唔會用輸入輸出訓練。處理客戶名單、未公開報價或公司程式碼時,本機方案可以減少資料交畀外部服務,不過公司仍要定清楚邊類文件可入模型、邊個可睇記錄,同模型輸出點覆核。
現階段較實際係分工:敏感文件摘要、重複改稿、離線 code 協助交畀 7B 或 8B 量化模型;要最新資料、複雜推理或完整工具鏈就用雲端。先用現有電腦試清楚兩三個固定工作,再決定值唔值得加 RAM 或買 GPU,會穩陣過見到模型成功答第一句就開始砌 AI 主機。
參考來源
- XDA Developers — I started self-hosting LLMs and absolutely loved it — original report
- Ollama FAQ — 官方交代本機資料處理、local-only 設定、模型儲存、記錄檔同預設網絡綁定。
- DeepSeek-R1 7B — Ollama Model Library — 官方模型頁列出 7.62B 參數、4.7GB 檔案、Q4_K_M 量化同授權資料。
- LM Studio System Requirements — 官方列出 macOS、Windows、Linux 支援範圍,以及 RAM、VRAM 建議。
- LM Studio Offline Operation — 官方說明聊天、文件處理、本機 server 同仍要連網嘅操作。
- LM Studio Serve on Local Network — 官方提醒非 localhost 綁定會向其他裝置開放,並建議加認證。
- ChatGPT Data Controls FAQ — 官方解釋個人帳戶訓練選項、Temporary Chat 同資料保留安排。
- OpenAI Business Data Privacy — 官方交代 Business、Enterprise 同 API 預設唔會用客戶輸入輸出訓練。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







