普通電腦自己跑 LLM 值唔值?私隱同成本背後仲有幾筆數
3C 產品

普通電腦自己跑 LLM 值唔值?私隱同成本背後仲有幾筆數

圖片:via XDA Developers — https://www.xda-developers.com/i-started-self-hosting-llms-and-absolutely-loved-it/
TechLab 編輯部(譯)·

Ollama、LM Studio 嘅安裝門檻、硬件限制同私隱設定

XDA 作者 Raghav Sethi 用一部 M1 MacBook Air、16GB unified memory,經 Ollama 跑 DeepSeek-R1 7B,再加 Open WebUI 做聊天介面。佢話簡單改 code、起草同離線工作都夠用,亦冇訂閱費。不過呢個體驗最值得睇嘅地方,係今日普通電腦確實跑得郁小型 LLM;至於可唔可以頂替 ChatGPT,答案仍然好視乎工作種類。

16GB RAM 係較穩陣嘅起步點

作者用嗰個 DeepSeek-R1 7B,其實係 7.62B 參數嘅 Q4_K_M 量化版本,Ollama 顯示模型檔案約 4.7GB。但硬碟放得落,唔代表得 4.7GB RAM 就夠,模型載入後仲有 context cache、系統同其他 app 爭記憶體。LM Studio 官方建議 Mac 同 Windows 最少準備 16GB RAM,Windows 獨立顯示卡就建議有 4GB VRAM;8GB Mac 仍可試細模型,但 context 唔可以開得太進取。

Apple Silicon 嘅 CPU 同 GPU 共用記憶體,裝好 app、揀模型再載入已經可以開始。Windows 情況較碎,模型有機會一部分放 VRAM、一部分放 RAM,速度亦會受顯示卡、記憶體頻寬同量化版本影響。XDA 原文冇提供 token/s 或耗電數字,只話單獨跑 7B 尚算順,一邊開其他工作就會慢,所以唔應該將呢部 M1 Air 嘅主觀感受當成所有 16GB 電腦嘅保證。

Ollama 易自動化,LM Studio 易上手

Ollama 適合肯用 command line、想接 editor 或自建工具嗰班人,下載模型、啟動本機 API 同睇 CPU/GPU 分配都有現成指令。LM Studio 就有圖像介面,搜尋、下載同切換 GGUF 模型都方便直接,仲可以將 PDF 等文件留喺機內做摘要或問答。安裝本身已經唔算難,較花時間反而係試模型:同樣寫住 7B,訓練資料、prompt 格式、量化精度同 context 長度都會左右答案。

對模型質素亦唔好預期太高。XDA 作者用 7B 模型處理簡單 code 尚算滿意,但問第一代 iPhone 時,模型竟然答 1986 年。呢類細模型可以幫手整理內部會議筆記、歸納合約段落、改寫電郵或先掃一次程式碼,涉及最新資料、複雜推理同關鍵事實就要再查。雲端模型仲有搜尋、較大 context、圖片處理同持續更新,功能差距唔會因為本機模型成功開到就消失。

本機運算都要逐項關好私隱

Ollama 官方話,純本機模型嘅 prompt 同答案唔會交返畀 Ollama;不過新版亦有雲端模型同網上搜尋,要設定 disable_ollama_cloudOLLAMA_NO_CLOUD=1,先可以明確鎖成 local-only。LM Studio 下載好模型後,聊天、文件處理同 localhost server 都可離線,但搜尋及下載模型、取得 runtime、檢查更新仍會連網。即係公司文件可留喺電腦處理,但模型來源、更新流量同第三方外掛仍要管。

資料留喺本機亦代表責任落返自己度。聊天記錄、模型、文件索引同 server log 都會佔用硬碟,電腦備份、磁碟加密、帳戶權限同惡意軟件同樣要顧。Ollama 預設只綁 127.0.0.1;LM Studio 亦提醒,只要改成 0.0.0.0 供其他裝置連入,就應開認證。XDA 作者用 Open WebUI、Ngrok 同基本登入做遙距存取,呢套組合多咗幾個要更新同保護嘅環節,唔適合裝完就長期唔理。

慳訂閱費之前,先計硬件同時間

Ollama、LM Studio 同唔少模型都可以免費用,DeepSeek-R1 7B 呢個版本亦列明 MIT License。不過仲要計 SSD 空間、下載時間、電費、維護成本,同埋跑模型拖慢部電腦造成嘅影響。未量度整部機喺自己工作量下嘅功耗,冇辦法負責任咁寫每月慳到幾多;如果手上已有 16GB 電腦,只係間中摘要文件,額外電費通常較易接受。若果要特登買高階 GPU,只為避開一個月費,條數未必合理。

ChatGPT 本身有免費層,付費方案買到較高用量、較強模型、搜尋同其他整合,但仍設使用限制。個人帳戶亦可以關掉用對話改善模型;Business、Enterprise 同 API 就預設唔會用輸入輸出訓練。處理客戶名單、未公開報價或公司程式碼時,本機方案可以減少資料交畀外部服務,不過公司仍要定清楚邊類文件可入模型、邊個可睇記錄,同模型輸出點覆核。

現階段較實際係分工:敏感文件摘要、重複改稿、離線 code 協助交畀 7B 或 8B 量化模型;要最新資料、複雜推理或完整工具鏈就用雲端。先用現有電腦試清楚兩三個固定工作,再決定值唔值得加 RAM 或買 GPU,會穩陣過見到模型成功答第一句就開始砌 AI 主機。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook