Gemma 4 E4B 本機運行指南:8GB 開到,量化同 context 決定實際表現
3C 產品

Gemma 4 E4B 本機運行指南:8GB 開到,量化同 context 決定實際表現

圖片:via XDA Developers — https://www.xda-developers.com/gemma-4-e4b-is-small-enough-to-run-anywhere/
TechLab 編輯部(譯)·

Raspberry Pi 都跑到,一般 laptop 要揀啱版本先實用

Google 四月發布 Gemma 4,XDA 作者 Ayush Pande 最近再用細型 E4B 跑 Raspberry Pi、舊顯示卡同幾套自架工具,結果好過佢預期。不過「任何裝置都跑到」呢句講得太盡:開到、出字快、答得準係三回事,用邊款量化、留幾長 context,同部機剩返幾多 RAM 都會改變體驗。

4.5B effective 唔等於 4GB RAM

E4B 屬 dense model,冇 MoE 嗰套 expert routing。Google 用 Per-Layer Embeddings(PLE)畀每層 decoder 自己一張 embedding table,計算量相當於 4.5B effective parameters,不過連 embeddings 計足約有 8B。換句話講,個名睇落似普通 4B 模型,權重體積其實大一截。佢支援文字、圖片同聲音輸入,context 上限係 128K,但支援到唔等於低 RAM 電腦開盡 128K 都會順。

Gemma 4 官方主視覺,深色背景中間展示立體 Gemma 4 字樣

圖片:Google

8GB 可以試,16GB 用起上嚟鬆動好多

Google 估算載入完整模型所需嘅 RAM 時,已經計埋約 20% overhead,但未包括 runner、KV cache、作業系統同其他 app。唔同格式亦唔可以淨係睇「4-bit」三個字,實際 RAM 同下載大小可以差好遠:

格式 官方載入模型 RAM 估算
BF16 17.9GB
SFP8 8.9GB
Q4_0 4.5GB
Mobile 2.5GB;純文字 2.2GB

官方 QAT Q4_0 GGUF 主檔係 5.15GB;常見社群 Q4_K_M 約 5.41GB,Q8_0 就去到 8.03GB。XDA workstation 截圖顯示用緊 Q4_K_M,另載入約 0.99GB multimodal projector。8GB 機較適合純文字、短 context 同關掉其他大型 app;要分析圖片、開長文件或者同時跑 RAG database,RAM 餘位會好快用晒。Mobile 版嘅 2.2GB 至 2.5GB 係 LiteRT-LM 專用格式,唔可以當成一般 Windows 或 macOS GGUF 嘅體積。

Google 官方表格,列出 Gemma 4 各型號喺多個 benchmark 嘅成績

圖片:Google

Raspberry Pi 跑到,不過速度差距可以好誇張

XDA 作者喺 Raspberry Pi 5 8GB 錄得每秒 2.95 至 3.25 token,GTX 1080 就有每秒 30 至 40 token,RTX 3080 Ti 接近 GTX 1080 三倍。呢批係作者個人測試,Pi 用咩量化同 context 冇交代;workstation 截圖雖然見到 Q4_K_M、llama.cpp 同 100K context,全文亦冇完整列出 prompt 長度、sampling 設定同重複測試方法,所以只適合當硬件級別嘅方向,唔適合直接橫比。

Apple Silicon 嘅統一 RAM 配合 Metal,短 context 跑 E4B 可以幾爽快,不過長文件會即刻現形。一份 oMLX 社群測試用 16GB base M4 跑 4-bit 版,1K context 約有每秒 22.2 token、峰值用 6.0GB;推到 128K 後跌到每秒 0.3 token,峰值升至 9.4GB。呢個例子講得幾清楚:16GB M 系列適合日常摘要同短至中篇文件,128K 只應按工作需要先開

下載前先睇清楚 runner 揀咗咩版本

想簡單試,可以喺 LM Studio 揀 Gemma 4 E4B QAT 4-bit;用 llama.cpp 或 Ollama,亦可以直接載入 Google 官方 Q4_0 GGUF。Ollama 指令係 ollama run hf.co/google/gemma-4-E4B-it-qat-q4_0-gguf:Q4_0。要留意,一般 ollama run gemma4:e4b 對應嘅套裝標示為 9.6GB,低 RAM 機下載完先發現放唔落就幾無謂。8GB 機可由 4K 至 8K context 開始,先跑純文字;真係要睇圖或聽聲先載入 projector。

摘要同輕量 code 幫到手,agent 工作未夠穩

XDA 作者用 E4B 摘 PDF、整理 Open Notebook 同 Blinko 嘅 RAG 結果、生成標籤、睇長 server log 同搵 code 問題,整體評價正面。不過模型叫唔到 Docker MCP 建立 container,寫完整 Ansible Playbook 亦有多處錯誤;放入 Home Assistant 後,佢會揀錯裝置同搞亂複雜 ifthen 條件。Google 公布嘅 E4B 成績同樣顯示個天花板:LiveCodeBench v6 得 52%,128K 長文檢索測試 MRCR 得 25.4%。

獨立 DataRaceBench 研究用 Q8 版 E4B 配 H200 測試 OpenMP code,104 個案例入面,模型解釋啱 82 個、修正啱 73 個;加入額外工具資料後,部分成績反而跌咗。呢套硬件同量化設定冇法直接套落一般 laptop,不過測試結果反映,E4B 較適合做輔助工具:畀佢解釋、起稿同指出可疑位置幾合適,自動改 production code 或操作家居同 server 就要逐步核對

私隱同 API 成本有實際著數

模型、文件索引同對話全部留喺自己部機,敏感筆記、未公開 code 或公司文件毋須交去雲端,斷網亦照用;Apache 2.0 授權亦容許商用、修改同再分發。當然,本機 app 一接 web search、雲端同步或外置 MCP,資料仍有機會離開部機,要逐項睇設定。學生、developer 同小公司如果經常處理固定格式文件,E4B 可以省返持續 API 費;偶爾先問一兩次複雜問題,雲端模型通常快同準好多。

點揀最實際

手上有 16GB Apple Silicon 或有足夠 VRAM 嘅 laptop,可以由官方 QAT Q4_0、8K context 開始;8GB 舊機就當佢係純文字、固定任務助手。摘要、資料抽取、草稿同輕量 code review 係較穩陣嘅用途,複雜 agent、長篇文件推理同會直接改系統狀態嘅工作,仍然要配較大模型同人手覆核。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook