舊 laptop 跑本地 AI:6GB VRAM 夠用,功能少過 ChatGPT
3C 產品

舊 laptop 跑本地 AI:6GB VRAM 夠用,功能少過 ChatGPT

圖片:via XDA Developers — https://www.xda-developers.com/i-replaced-chatgpt-with-a-local-model-running-on-my-old-laptop/
TechLab 編輯部(譯)·

「舊 laptop 都跑到 AI」聽落幾吸引,但 XDA 呢次成功個案有個重要前提:作者 Ayush Pande 用緊 2017 年 Acer Predator Helios 300 gaming laptop,入面仲有 GTX 1060 6GB 同 16GB DDR4 RAM。佢喺 Proxmox LXC 入面自行編譯 Vulkan 版 llama.cpp,再跑 Gemma 4 E4B。部機確實舊,硬件底子就高過好多冇獨立 GPU 嘅文書機,唔可以見到「old laptop」就當任何舊機都有同樣表現。

6GB VRAM 係參考線,唔係官方最低要求

Google 官方估算,Gemma 4 E4B 嘅 Q4_0 版載入時約佔 4.5GB GPU/TPU 記憶體,數字已計 20% 額外開支;XDA 用嘅 Q4_K_M GGUF 檔本身有 4.98GB,視覺 projector 另加 992MB,硬碟空間就要預留約 6GB。真正跑起仲有 context、KV cache 同其他程式開支,context 開得愈大,RAM/VRAM 壓力愈高。6GB VRAM 加 16GB RAM 只可當今次個案嘅參考配置;llama.cpp 亦可用 CPU,但原文冇測純 CPU 或 8GB RAM 機,速度唔可以靠估。

Google 公布嘅 Gemma 4 型號測試表,E4B 喺多項推理成績落後大型版本

圖片:Google

普通用家唔使照搬 Proxmox

作者用 Proxmox 9.0、Nvidia 580 driver、LXC GPU passthrough,同手動編譯 Vulkan backend,主要係遷就舊 Pascal GPU 同佢本身嘅 server 架構。想喺一般 Windows 機先試,llama.cpp 可用 winget install llama.cpp 安裝,再用 llama serve -hf ggml-org/gemma-4-E4B-it-GGUF:Q4_K_M 下載模型同開 web UI;macOS、Linux 亦有 installer。想少打 command,可以用 LM Studio 或 Ollama。先跑純文字最穩陣,影像功能仲要另載 projector;Gemma 4 模型卡列明 Apache 2.0 授權,GGUF 就應該喺 ggml-org 等可核實來源攞,唔好下載來歷唔清楚嘅轉檔。

30+ tokens/s 夠傾偈,未代表答案夠好

XDA 作者話 GTX 1060 跑到 30+ tokens/s,約係佢 RTX 3080 Ti 設定三分一速度,但用嚟即時對話同 Home Assistant 回應已經順。呢個只係單一配置嘅生成速度,原文冇交代首字延遲、長 prompt 處理、耗電、持續負載溫度,亦冇用同一批問題同 ChatGPT 做答案對照。Google 官方嘅無工具測試顯示,E4B 喺 AIME 2026 得 42.5%,31B 版就有 89.2%。細模型再加 Q4 量化換到速度同低記憶體,複雜推理會有明顯折扣。

私人文件、摘要同 RAG 最對路,廣東話未有實證

作者之前用 Gemma 4 E4B 做過圖片辨識、摘要同 RAG 搜尋,今次又接入 Paperless-ngx:Paperless-GPT 負責 OCR,Paperless AI 做標籤同文件問答。資料範圍固定、工作重複、答案可以覆核,正正係舊機本地模型最啱做嘅嘢。Google 話 E4B 有 128K context,預訓練涵蓋 140+ 語言,開箱支援 35+ 語言;不過 XDA 冇測中文或廣東話,官方亦冇廣東話獨立成績。用嚟摘要繁中文件可以試,想佢穩定寫自然香港粵語,暫時冇數字背書,尤其公司文件一定要抽查事實、術語同漏項。

同 ChatGPT 免費版比,最大差距係工具

OpenAI 官方資料顯示,ChatGPT 免費版而家用 GPT-5.5,包網上搜尋、資料分析、檔案/圖片上載、圖片生成、GPTs 同 500MB Library,不過 GPT-5.5 每五小時只畀免費用家用有限次數,其他工具亦有獨立 quota。本地 Gemma 下載完可以離線跑,冇每幾小時停用嘅限額,亦唔使訂閱;代價係 冇現成網上搜尋、圖片生成同雲端工具鏈,要自己接 RAG 或 MCP。Gemma 4 訓練資料截到 2025 年 1 月,喺 2026 年 7 月問新消息,冇搜尋就答唔到最新資料,答案質素亦冇直接測試證明追到 GPT-5.5。

本地跑都要睇成條資料鏈

XDA 作者最重視私隱,銀行文件、身份證同學業紀錄留喺自己部機,確實少咗交畀雲端模型處理嘅風險。不過「local」只保證推理位置;OCR、embedding、MCP server 或 web UI 插件一旦連外,資料仍可能離開部機。作者個 --host 0.0.0.0 設定亦會畀同一個 LAN 嘅其他裝置連入,防火牆、登入驗證同系統更新唔可以慳。ChatGPT 個人用家可以關掉「Improve the model for everyone」,Temporary Chat 亦唔會用嚟訓練,但內容始終要傳去 OpenAI,Temporary Chat 最多可保留 30 日。處理公司文件仲要跟公司 IT 同資料分類規則,本地模型唔會自動解決合規。

邊類舊機值得試

呢次個案證明,有 6GB VRAM 嘅九年舊 gaming laptop 仍可變成實用 AI server,尤其適合固定、重複、講私隱嘅工作。所謂取代 ChatGPT,只限作者嗰批 workflow;臨時查新資料、複雜推理同即用雲端工具,免費 ChatGPT 方便好多。屋企有 GTX 1060 同級舊機,可以先裝純文字 Q4 模型試速度;如果只得純 CPU 文書機,就先實測生成速度同答案準確度,唔好直接套用 XDA 個 30+ 數字。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook