
Gemma 4 12B 本機 AI:16GB laptop 跑得起,取捨要睇清
私隱同離線好吸引,但 RAM、GPU 同工具成熟度要先計清
本機 AI 由玩具變工作工具
XDA 作者 Abhinav Raj 今次講 Gemma 4 12B 喺 16GB laptop 上做到睇 screenshot、聽錄音、讀文件,而且唔使資料走上第三方 server。呢個賣點唔算新,但放喺 multimodal AI 就開始有實際價值:以前你想用 AI 摘錄會議錄音、睇合約 PDF、整理客戶資料,方便同私隱好多時係互相拉扯;而家本機模型終於夠大,處理能力又未至於細到只可以玩 demo。

圖片:Google
Google 點樣塞入 12B
Google 6 月 3 日公布 Gemma 4 12B,重點係 unified、encoder-free 架構。傳統 multimodal 模型通常要靠獨立 vision/audio encoder,先攞圖片同聲音轉成模型識睇嘅表示;Gemma 4 12B 改用輕量 vision embedder,聲音亦用 16kHz audio frame 直接投射入 LLM 空間。官方講法係少咗記憶體同延遲負擔,亦令 12B 呢個級數可以喺 laptop 做 agent、coding、文件分析同音訊理解。Model card 亦列明 Apache 2.0 license、最高 256K context window,輸入包文字、圖片同 audio;影片理解就靠處理連續 frames;輸出主要係文字。呢啲背景解釋到點解 XDA 作者會覺得佢似一套本機工具箱,唔再淨係另一個細 LLM。

圖片:Google
16GB 夠用,但條件要講清
最易誤會係「16GB laptop」。Google launch blog 寫 consumer laptops with 16GB RAM;Developer Guide 就寫 dedicated GPU laptop with 16GB VRAM or unified memory。兩句放埋一齊睇,意思唔係任何 16GB Windows 文書機都會順。Google AI 文件列出 Gemma 4 12B inference 記憶體:BF16 約 26.7GB、SFP8 約 13.4GB、Q4_0 約 6.7GB,仲未計 context window 同 runtime 額外開支。LiteRT-LM model card 嘅參考數字就係 model size 6,235MB,MacBook Pro M4 GPU memory 約 7,763MB,Linux 上 AMD Radeon AI PRO R9700 約 8,064MB。
XDA 作者自己用 Lenovo Legion 5、mobile RTX 3070 8GB VRAM 去餵 BIOS screenshot、benchmark graph 同效能資料,呢個環境其實已經好過好多薄身 laptop。換句話講,16GB RAM 只係入場券,保證唔到每次都順;你要睇 GPU/統一記憶體、量化版本、context 開幾長,仲有同時開住幾多 app。
真正有用嘅位:資料留喺機入面
對打工仔、freelancer、中小企 IT 嚟講,Gemma 4 12B 最啱用嘅位其實係敏感資料處理:合約 PDF、客戶名單、內部簡報、會議錄音、截圖入面嘅系統資料,全部盡量留喺機入面,少啲交畀雲端 AI。XDA 作者提到佢用 Gemma 4 讀 BIOS 頁面、benchmark data 同 performance graph,再抽成乾淨表格;Google 官方亦示範過用 AI Edge Gallery 喺本機寫 Python、跑 script、畫 chart。
Audio 亦值得睇。Google Eloquent for macOS 主打本機 dictation、audio/影片轉錄同 voice edit;model card 亦寫 12B 支援 ASR 同 speech-to-translated-text。呢啲功能如果做得穩,會令「唔想交錄音畀網上服務」呢件事少啲痛苦。不過要再講清楚,以上係官方同 XDA 資料,唔係我哋本機測試。
工具鏈仲未完全追上模型能力
模型能力同你今日手上嗰套工具,唔一定同步。Hugging Face 上 LiteRT-LM 版 model card 寫得幾直:呢個 .litertlm 套件 ready for macOS and Linux,current LiteRT-LM version 支援 text 同 audio,image 同 MTP 會之後補上。另一邊,AI Edge Gallery GitHub release 又有 Ask Image/Ask Audio 同 MTP 開關。即係模型、app、CLI endpoint 三層要分開睇,唔好見到「Gemma 4 支援 multimodal」就以為每個入口都一樣完整。
Google 文件亦確認 LiteRT-LM CLI 可以開 OpenAI-compatible server,預設 9379,提供 /v1/chat/completions,所以本機模型可以接 Continue、Aider、OpenCode、Open WebUI 呢類工具。呢點對 coding agent 好實際:唔使每次交 repo 片段、錯誤 log、客戶代碼上雲端。不過雲端模型仍然喺穩定性、多人共享、長任務同模型質素上限有優勢。
應該點揀
如果你而家用 Apple Silicon MacBook 16GB unified memory,Google AI Edge Gallery/Eloquent 路線最清晰,值得試。Windows 16GB 但冇獨立 GPU,就要預期細模型、4-bit 量化或者雲端 AI 仍然係主力;有 8GB VRAM GPU 嘅 gaming laptop / workstation 可以試 Gemma 4 12B,但 context 唔好一開就推盡,OS、瀏覽器同 IDE 都要食 RAM。
我會咁睇:Gemma 4 12B 令本機 AI 由 hobbyist 玩具走近實際工作,尤其係文件、錄音、截圖、coding agent 呢幾類。但佢未取代 ChatGPT、Gemini 或 Claude;如果你嘅痛點係資料唔方便上雲、token 成本開始肉赤、或者成日喺冇穩定網上環境下工作,先值得花時間砌本機工具鏈。下一步要睇 Google 點樣補齊 Windows、image input 同 endpoint 能力。
參考來源
- XDA Developers — Gemma 4 sees, hears, and reads on my 16GB laptop, and it never phones home — original report
- Introducing Gemma 4 12B: a unified, encoder-free multimodal model — Google 官方發布文,用嚟核對 16GB、Apache 2.0、encoder-free、multimodal 能力同發布日期。
- Gemma 4 12B: The Developer Guide — 核對 16GB VRAM / unified memory、macOS apps、LiteRT-LM endpoint、OpenCode 同 llama.cpp 例子。
- litert-community/gemma-4-12B-it-litert-lm — 核對 LiteRT-LM 套件支援範圍、model size、MacBook Pro M4 同 Linux GPU memory 參考數字。
- Gemma 4 model overview — 核對 Gemma 4 memory requirement table、context window 同 memory planning 注意位。
- OpenAI-Compatible Server | Google AI Edge — 核對 LiteRT-LM serve 本機 OpenAI-compatible API、預設端口同 endpoint。
- Releases · google-ai-edge/gallery — 核對 AI Edge Gallery app release 對 Gemma 4、Ask Image、Ask Audio 同 MTP 嘅支援狀態。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







