16GB RAM 筆電點跑 Gemma 4:版本點揀、廣東話點驗收
3C 產品

16GB RAM 筆電點跑 Gemma 4:版本點揀、廣東話點驗收

圖片:via XDA Developers — https://www.xda-developers.com/gemma-4-is-lightweight-runs-on-my-16gb-laptop-and-costs-0-to-keep-me-productive-offline/
TechLab 編輯部(譯)·

由 E4B QAT 入門,拆清楚 RAM、速度同私隱取捨

XDA 作者用 Gemma 4 E4B 喺 16GB RAM 筆電離線整理筆記、辨認手寫內容同寫 code,最大賣點係冇網絡都用到,亦冇每月訂閱費。不過原文冇公開 CPU、GPU、量化檔、context 長度同每秒生成幾多 token,連獨立顯示卡資料都欠奉。呢個體驗只可以話作者部 16GB 筆電跑得郁,唔代表其他 16GB 筆電都會順。

先拆清楚 16GB 係咩

16GB 系統 RAM 同 16GB VRAM 完全兩回事。 一般 Windows 筆電嘅 RAM 要留位畀系統、瀏覽器同其他軟件;獨立 GPU 嘅 VRAM 就另外計。Apple Silicon 用統一記憶體,CPU 同 GPU 共用同一組記憶體,情況又唔同。冇獨立 GPU 都可以靠 CPU 跑 GGUF 模型,不過生成速度通常會慢一截,機款、記憶體頻寬同散熱都會直接影響體感。

Google 官方估算,Q4_0 版本載入基本權重時,E2B、E4B、12B、26B A4B 同 31B 分別約用 2.9GB、4.5GB、6.7GB、14.4GB 同 17.5GB GPU/TPU 記憶體。呢堆數字仲未計長 prompt 所用嘅 KV cache。Ollama 實際下載檔亦會因格式有落差,例如預設 E4B 約 9.6GB,12B 約 7.6GB,單睇型號個「B」字揀模型好易估錯。

Gemma 4 喺手機、電腦同邊緣裝置運行嘅官方示意圖

圖片:Google Developers Blog

16GB 筆電由 E4B QAT 開始最穩陣

得 16GB 系統 RAM,我會先揀 Gemma 4 E4B instruct QAT Q4_0,context 由 4K 或 8K 起步,唔好一開就拉到 128K。E2B 慳位同反應快,適合分類、短摘要同簡單改寫;12B Q4 理論上都裝得落,但 Windows、其他 app 同 KV cache 會食走餘量,純 CPU 筆電亦可能等得耐。26B Q4 已貼近 16GB 上限,31B 就直接超出,唔適合當普通 16GB 筆電嘅入門選擇。

想用圖像介面,可以喺 LM Studio 搵 Google 或 LM Studio Community 發佈嘅 gemma-4-E4B-it QAT Q4_0 GGUF,下載後關掉網上 provider,先用細 context,再按顯示卡容量調 GPU offload。鍾意指令列就裝 Ollama,用 ollama run gemma4:e4b-it-qat 啟動;Ollama 模型庫標示呢個 QAT 版本約 6.1GB。下載前要睇清楚 tag,gemma4:e4b 預設檔同 QAT 檔唔係同一大小。

廣東話支援要自己驗收

Google 話 Gemma 4 預訓練涵蓋逾 140 種語言,官方模型卡就寫明開箱支援 35 種以上語言,但兩個講法都冇證明香港粵語寫得自然。HKCanto-Eval 已有粵語理解、地道文化、摘要、翻譯同粵拼等測試框架,不過今次研究未見 Gemma 4 嘅公開成績。XDA 原文亦冇測繁體中文或粵語,所以唔應該由「多語言」三隻字推斷佢識分「唔/不」、「嘅/的」或者港式用詞。

自己驗收時,可以固定 temperature 同 context,逐個版本跑同一批材料:先畀一段粵語會議記錄,要求保留人名、日期同待辦事項;再叫佢將書面中文改成自然香港粵語,檢查有冇混入簡體字同普通話句式;最後放一段繁體中文規格,要求只按原文摘要,睇吓會唔會作數字。每題跑三次,記低首 token 等候時間、每秒 token、RAM/VRAM 峰值同錯漏,先有得公平比較。

Coding 方面有較實在嘅外部數據。KodeLab 用繁體中文出 84 題 LeetCode 類 Python 題,no-think 模式下 E4B 全部測資通過率係 58.3%,12B 就係 70.2%。同一測試喺 32GB M4 Mac mini 跑,E4B 約 29.87 token/s,12B 約 12.5 token/s;呢啲速度唔可以搬落其他 16GB 筆電照計,但清楚反映細模型反應爽快,複雜 coding 就較易失手。

私隱較易掌握,但唔係零成本

模型、文件同對話全留喺本機,確實適合離線整理公司會議記錄、內部草稿或者冇穩定網絡時工作。不過 LM Studio 或 Ollama 本身離線,唔代表連接嘅 Obsidian plugin、搜尋工具同同步服務都離線;敏感文件仍要配合磁碟加密、存取權限同公司政策。所謂零成本亦只係冇逐次收費,硬件、電力、SSD 空間、下載時間同設定工夫照樣要計。

16GB 筆電想試本地 AI,E4B QAT 係合理起點:短摘要、資料分類同簡單寫作可以交畀佢,重要事實同粵語文稿要人手覆核。要查最新資料、處理複雜推理或者追求穩定廣東話文風,雲端大模型暫時仍然省時間;敏感文件同離線工作就留畀本機模型,實際用落會穩陣啲。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook