
Raspberry Pi 5 跑 Gemma 4 E2B:8GB RAM 做到文件摘要,速度代價要接受
本機 AI 免月費又保私隱,量化、散熱同 context 都有限制
Gemma 4 E2B 最吸引嘅地方幾直接:一部 Raspberry Pi 5 已經可以離線跑到有推理、圖片同語音輸入能力嘅模型。XDA 作者用佢摘要 PDF、整理文章,亦接駁過 Karakeep 同 Paperless-GPT,結果足以應付輕量工作。呢啲都係 XDA 嘅體驗,TechLab 冇親手測試;不過由兩組速度數字睇,佢至少唔再係問一句要等半分鐘嗰類展示品。
E2B 個名容易令人低估硬件要求
Google 官方模型卡寫得好清楚,Gemma 4 E2B 嘅有效參數量約 2.3B,連同 embedding 實際共有 5.1B 參數。個「E」解作 effective,靠 Per-Layer Embeddings 將大量參數放喺每層快速查表用嘅 embedding,而主要運算量維持喺約 2.3B 水平。XDA 解釋,推理期間只會將用到嘅部分映射入記憶體,所以 Raspberry Pi 都頂得住;但模型檔案、儲存讀取同 RAM 壓力,唔會跟住「2B」三個字一齊消失。
量化版本亦會直接改變結果。LocalLLaMA 一項社群測試用 Raspberry Pi 5 8GB、NVMe SSD 同 Ollama,比較預設嘅 Gemma 4 E2B Q4_K_M;模型佔約 7.2GB 儲存,文字生成錄得平均 5.53 token/s。呢個測試只得四條推理題,對手量化格式亦唔相同,唔適合當正式排名,不過速度同 XDA 錄得嘅 5.8–6.5 token/s 幾接近。想照住砌,8GB RAM、64-bit 系統同夠快嘅儲存會穩陣好多,NVMe 對載入同記憶體映射亦實際過慢速 microSD。

圖片:Google
五六個 token 一秒,可以攞嚟做咩
五六個 token 一秒,大概即係答案會逐句出;普通問答仲可以接受,生成長文就要明顯等耐啲。啱佢做嘅工作包括批次摘要 PDF、替文件加標籤、整理家居 server 記錄、將 Home Assistant 狀態變成人話,或者解釋一小段程式碼。至於 IDE 即時補全、大型專案重構、多步 agent 任務同大量圖片分析,速度同準確度都未夠鬆動。XDA 話 E2B 辨認一般相片同介面元素表現唔錯,遇到冷門 app 畫面就會失手,呢個界線幾合理。
Google 標示 E2B 支援 128K context,但呢個係模型能力,唔等於 Raspberry Pi 可以舒服咁食盡。context 拉長會令 KV cache 同 prompt 處理開支上升,8GB 機仲要預位畀系統、推理程式同其他服務。實際部署應該由較短 context 開始,長文件切件摘要,再合併重點;硬塞成份文件入去,只會令首個答案等得耐,亦未必答得準。Google 自家 MRCR 128K 長文本測試入面,E2B 平均只有 19.1%,個 128K 標示唔應該當成理解能力保證。
私隱同成本有優勢,但要守好出入口
模型權重採用 Apache 2.0 授權,本機運行冇逐次 API 費,亦唔使交 AI 月費。文件留喺屋企部機,對私人筆記、帳單、內聯網資料同家居狀態幾有吸引力。不過「本機」只描述模型喺邊度運算:如果前端有遙測、語音辨識另用雲端,或者 agent 接咗外部搜尋 API,資料一樣可能離開部機。自架服務仲要計電力、SSD、散熱同維護時間,免訂閱唔代表完全零成本。
LLM 推理會長時間壓住 CPU,主動散熱值得一開始就預埋。Raspberry Pi 官方測試指出,Pi 5 持續重載又冇散熱,就會去到溫度限制,跟住降頻;Active Cooler 就可以將長時間負載溫度穩住。降頻會令本身已經唔快嘅生成速度再跌,所以細機箱塞入櫃、長期批次摘要或者家居 automation,風道同風扇絕對唔係裝飾。
E4B 聰明啲,Pi 5 就嫌慢
XDA 用 Raspberry Pi 5 8GB 跑 Gemma 4 E4B,只錄得約 2.5–3 token/s,但佢成功寫到 E2B 同其他小模型做唔到嘅 Pi agent extension,亦可以產生正確 Docker 指令。呢個結果反映細板部署嘅取捨:E2B 適合固定、低風險同可以慢慢完成嘅工作;要複雜 coding 或多步操作,E4B 放去舊 laptop 會實際好多。家居 automation 最好畀模型摘要狀態或者草擬動作,再由規則同人手確認,唔好直接交門鎖、暖爐或刪檔權限畀佢。
參考來源
- XDA Developers — Gemma 4 E2B proves Raspberry Pi-sized LLMs don't have to be terrible anymore — original report
- Gemma 4 model card — 核對參數量、PLE 架構、128K context、功能、官方 benchmark 同限制
- Gemma 4: Byte for byte, the most capable open models — Google 官方發布資料、Apache 2.0 授權同 edge 裝置定位
- Gemma 4 Technical Report — Gemma 4 架構同評測方法嘅原始技術資料
- Gemma 4 E2B and Qwen 3.5 2B Raspberry Pi 5 community benchmark — 獨立社群提供 Pi 5 8GB、NVMe、Ollama、量化格式、速度同模型大小資料
- Heating and cooling Raspberry Pi 5 — Raspberry Pi 官方持續重載、降頻同主動散熱測試
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







