本機 LLM 唔係雲端 AI 縮水版:coding、私隱文件同舊電腦點分工
3C 產品

本機 LLM 唔係雲端 AI 縮水版:coding、私隱文件同舊電腦點分工

圖片:via XDA Developers — https://www.xda-developers.com/local-llms-used-prove-not-just-smaller-versions-cloud-models/
TechLab 編輯部(譯)·

離線跑 AI 最緊要睇任務、RAM 同 context

XDA 作者 Adam Conway 今次列咗 6 個佢用過嘅本機 LLM,由 coding 模型、長 context MoE,到可以睇圖聽聲嘅 Gemma 3n 類模型都有。呢類文章表面似 model list,但值得睇嘅位係:本機 LLM 而家唔再淨係「細一截、慢一截、平一截」咁簡單,唔少模型已經直接向記憶體、context、工具調用同多模態落手,解決嘅係雲端模型平時遮住咗嘅硬件問題。

本機跑,最值錢係私隱同重複工作

講真,如果你只係問一條冷知識、寫一段 email,ChatGPT、Claude 呢啲雲端模型仍然方便好多。本機 LLM 真正抵玩嘅位,係啲你唔想上雲、又要重複做嘅工作:公司內部文件摘要、合約草稿比對、學生自己整理筆記、開發者叫模型掃一個 repo、改測試、解釋 log。LM Studio 官方文件都寫明可以離線同文件對話,短文件可以直接塞入 context,長文件就用 RAG 搵返相關段落;呢類工作唔一定要最醒,但要夠近資料、夠平、夠可控。

LM Studio app 介面,展示本機模型用嚟寫 code 同調校 context

圖片:LM Studio

硬件門檻其實係記憶體門檻

好多新手以為買張勁 GPU 就搞掂,本機 LLM 麻煩位其實係記憶體。模型權重只係第一筆數,對話越長,KV cache 又會食多一截;Ollama 官方文件都提醒,context 設長咗會增加記憶體需求,coding tools、agent 同網上搜尋類工作最好有至少 64K token context。LM Studio 建議 Mac 同 Windows 都至少 16GB RAM,Windows x64 仲要 AVX2,獨立 GPU 至少 4GB VRAM 先算入門;8GB Mac 或純 CPU 迷你 PC 唔係唔得,但要玩細模型同短 context,唔好幻想長時間做大型 coding agent。

Gemma 3n 參數同 PLE caching 示意圖,顯示點樣減少記憶體佔用

圖片:Google AI for Developers

MacBook、Windows laptop、NAS 各有啱位

Apple Silicon 嘅優勢係 unified memory,32GB 或以上嘅 MacBook / Mac mini 做 7B、8B、14B 量化模型幾舒服,想試 30B 就要收細 context 或接受慢一截。Windows laptop 就睇 VRAM,多數情況下 NVIDIA 獨顯好過靠 CPU 死頂。NAS 同迷你 PC 反而適合做長開 server:放一個 OpenAI-compatible endpoint 喺屋企或辦公室 LAN,畀文件摘要、簡單分類、embedding、內部 bot 用。只係要講清楚,本機唔等於自動安全,權限、log、模型輸出留喺邊部機,一樣要管。

Coding 係最易見到回報嘅場景

Qwen3-Coder-Next 呢類模型就係好明顯嘅方向:Hugging Face model card 寫到佢係 80B total、3B active,原生 262K context,目標係 coding agent 同 IDE/CLI 工作流。呢啲數字唔代表你部 laptop 即刻跑得靚,但方向好清楚:本機模型開始針對「睇 repo、用工具、改完再修」呢類工作設計,而唔係淨係同你聊天。實際用法可以好務實:本機模型先掃 log、解釋舊 code、寫 unit test 草稿;真係牽涉架構決策、複雜安全問題、或者要最新網上資料,先揀返雲端模型。

同 ChatGPT / Claude 嘅分工要現實啲

我會咁分:涉及私隱原文、公司資料、API cost、低延遲同長期重複任務,就放本機;要最高準確度、最新資料、跨好多領域推理、或者一次過做高風險決定,就用雲端。呢個分法實際過淨係問「邊個模型勁啲」好多。你唔會因為屋企有 NAS 就放棄雲端備份,同樣道理,本機 LLM 係一層私有運算能力,唔係叫你熄晒外面所有 AI 服務。

下一步睇架構,唔好淨係睇參數

XDA 原文提到嘅重點,其實係好多模型都喺改寫舊 transformer 嘅成本結構:MoE 只啟用部分參數、linear attention 控制 context 記憶體、Gemma 3n 用 MatFormer 同 PLE caching 去壓低裝置需求,仲支援文字、圖片同聲音輸入。之後幾年睇本機 LLM,呢啲架構改動會比單睇參數更有參考價值。買硬件之前,先諗清楚自己係要 coding、文件、私隱資料處理,定係純粹想玩最大模型;任務揀啱,16GB 機都可以有用,揀錯方向,128GB 都只係燒電。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook