本地 LLM 唔使一款打天下:拆解 XDA 作者長留硬碟嘅 4 個選擇
3C 產品

本地 LLM 唔使一款打天下:拆解 XDA 作者長留硬碟嘅 4 個選擇

圖片:via XDA Developers — https://www.xda-developers.com/local-llms-i-keep-installed-for-different-jobs/
TechLab 編輯部(譯)·

由寫 code、日常問答到推理同創作,四款模型各有固定崗位

本地 LLM 最容易踩中嘅坑,係見到 benchmark 高就下載,最後硬碟塞滿一堆甚少開嘅模型。XDA 作者 Yash Patel 試用本地 AI 超過一年、轉過逾 20 款模型之後,留下 Qwen 3.6 27B、Gemma 4 12B、gpt-oss-20b 同一款社群版 Llama 3.3 8B,分別處理寫 code、日常問答、深入推理同創作。呢份係作者個人工作清單,唔係全面排名,亦唔係 TechLab 實測。

先睇部機,速度描述先有意思

作者用 32GB RAM、RTX 5070、Intel Core Ultra 9 同 1TB SSD,經 KoboldCpp 載入 GGUF 量化模型。不過原文冇交代顯示卡係桌面版定手提電腦版、實際 VRAM、context 長度、GPU offload 層數同每秒 token 數,所以「舒服」、「快」同「慢」都只可以當佢部機上嘅相對感受。四款模型嘅檔案合共約 43 至 45GB,呢個係硬碟用量,唔代表每次要用同等 RAM,仲唔使四款同時載入。

KoboldCpp 可以將部分模型層放入 VRAM,其餘留喺系統 RAM;官方文件講明,放入 GPU 嘅層數愈多,生成通常愈快。即係話,VRAM 唔夠未必完全開唔到,只係較多工作會落返 CPU,速度可能跌一截。LM Studio 嘅一般建議係 16GB 或以上 RAM、至少 4GB 獨立 VRAM,但對呢份清單入面個 18GB Qwen 檔案嚟講,32GB RAM 會係較穩陣嘅起點,仲要預位畀 context、KV cache 同其他軟件。

Qwen 3.6 27B:寫 code 揀質素,接受等耐少少

作者將寫 code、除錯、重構同閱讀舊 code 交畀 Qwen 3.6 27B。佢用嘅 Q5_K_S 檔案約 18GB,係四款入面最重;作者話大型 code 生成要等耐啲,不過輸出較乾淨,少咗之後執漏嘅時間。要留神,佢實際下載嗰款帶有「Fable Fusion」、「UnHeretic」等字眼,係建基於 Qwen3.6 嘅第三方融合及量化版本,唔等同阿里 Qwen 官方原版,效果同安全調校都唔可以直接算落官方模型頭上。

Gemma 4 12B:日常工作最易開機即用

Gemma 4 12B 負責快速問答、摘要、解釋概念、構思點子同簡單 coding 工作。作者用 Q4_0 instruction-tuned 量化版,檔案約 7 至 8GB,載入快過大模型,亦留到較多資源畀其他 app。呢類 12B、4-bit 模型比較適合第一次玩本地 LLM 嘅人:16GB RAM 電腦有較大機會跑得郁,若果模型大部分塞得入 VRAM,互動亦會爽好多。不過原文冇 token 速度,唔應該將「反應快」當成跨電腦結論。

gpt-oss-20b:複雜問題交畀佢慢慢拆

遇到多層問題、方案比較或者想檢查一個構思有冇漏洞,作者會轉用 gpt-oss-20b。佢嗰個 Q6_K 檔案約 11 至 12GB,回答慢過細模型,但作者願意用時間換較完整嘅推理。OpenAI 官方資料顯示,gpt-oss-20b 有約 21B 總參數,每個 token 動用約 3.6B 參數,並稱模型可喺 16GB 記憶體裝置運行;不過「開得到」同「回得快」差好遠,長 prompt、context 大細同 GPU offload 都會直接改變體感。

「Llama 3.3 8B」來源要睇清楚

作者用約 7GB 嘅 Q6_K 社群模型寫故事、人物設定同試唔同文風,貪佢細、載入快,改完 prompt 可以好快再試。不過呢款名稱雖然寫住 Llama 3.3 8B,Meta 官方 Llama 3.3 model card 只列出 70B;作者下載嗰款仲標榜 Thinking、Heretic、Uncensored 同 Claude 4.5 Opus 資料,屬社群微調版本,來源同訓練資料鏈冇官方模型咁清楚。攞嚟玩創作可以,處理客戶文件、內部資料或者要穩定重現結果,就要先評估來源同授權風險。

本地運行保障私隱,但要預留硬件資源

本地運行可以令 prompt 同文件留喺自己部機,下載好模型同工具之後亦可以離線用,對合約、未公開企劃同唔想上載雲端嘅資料幾實際;長用亦毋須按月交 AI 訂閱費。不過本地運行仍然要預留 SSD 空間、RAM、GPU 資源、電力同運算時間。對大部分人,先用 7 至 12GB 左右嘅量化模型處理日常工作,再按實際用途加一款較大模型,會易管理過一次過抄齊四款。至於社群「uncensored」改版,下載前最好先查清模型卡、作者同基礎模型來源。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook