Mac 跑本地 LLM 入門:16GB 應怎樣揀 model
AI 工具

Mac 跑本地 LLM 入門:16GB 應怎樣揀 model

圖片:TechLab 自製資訊圖
TechLab 編輯部·

先由 4B 級模型與實際工作負載開始,避免一開波就揀得太大

想在 Mac 自己跑本地大型語言模型(LLM),最重要不是先追最新或最大 model,而是先弄清楚記憶體會同時供 macOS、你正在開啟的程式,以及 model 使用。以 16GB 為起點,較穩妥的方向是由 4B 級小型 model 試起;它較貼近日常改寫、摘要、構思和一般問答的需要。

不過,現有資料不足以確認某一款 Mac、macOS 版本或 Ollama 版本的精確安裝指令,也不足以保證每一個 16GB Mac 都有相同速度。因此,這篇不會把未核實的指令當成萬用答案,而是提供可長期沿用的選擇方法:先以小 model 建立可用流程,再按實際記憶體壓力、回應速度及工作內容決定是否升級。咁樣揀,通常比單看參數更實際。

先理解:16GB 並不等於 16GB 全給 model

本地 LLM 運作時,model 本身只是記憶體開支的一部分。系統仍要維持 macOS、瀏覽器、通訊工具、文件編輯器及其他背景程序;而對話愈長,模型處理上下文亦會增加資源需求。即使同樣標示為某個參數規模,不同版本、量化方式、是否包含視覺功能,以及同時開啟多少程式,都會令所需空間和反應不同。

因此,16GB 應視為「適合由小 model 開始」而不是「可以任意載入 16GB 以下檔案」。若系統要頻密騰出記憶體,體感會由回答稍慢,變成整部機連切換程式都不順。對本地生成文字而言,持續、可預期的反應,比勉強載入一個較大 model 更有價值。

XDA 的一個實例使用 16GB RAM、整合式圖像核心的手提電腦,以 Ollama 運行 Gemma 3 4B,並以構思文章題目、摘要、解釋技術概念、改寫段落及一般問答評估日常實用性。這不是 Mac 的測試,也不能推論為所有 16GB 電腦的成績;但它支持一個很實用的起點:4B 級 model 的定位,是在資源有限的裝置上處理常見文字工作,而非取代大型雲端 model 的所有能力。

16GB 應該跑到邊隻 model?以規模分三段看

選擇方向 16GB 的建議 適合工作 主要取捨
小型 4B 級 model 建議作第一隻 model 摘要、改寫、構思、概念解說、一般問答 答案深度、複雜推理與專門知識未必及較大 model
較大 model 不宜只因參數較大便直接選用 有明確需求、且願意接受更高資源佔用時才考慮 可能令系統與回應變慢,實際可用性要自行驗證
視覺或額外組件 model 只在確實需要相關功能時考慮 需要處理圖像等特定工作 即使不用相關功能,額外組件亦可能帶來不必要負擔

這個表不是硬性相容性名單,而是決策次序。4B 是參數規模的標示,不代表不同 4B model 必然佔用相同資源或回答同樣好;你仍應以實際使用的 model 資訊和自己電腦的狀態為準。

另一個例子更能說明「小而可用」的價值:一部主要靠 CPU 推論的 NAS,運行 Qwen3 4B 時約為每秒 5.4 個 token,Gemma 3 4B 約為每秒 3.2 個 token。該作者指出 Gemma 3 4B 載入了未使用的 CPU 端視覺組件。這些數字只屬該 NAS,不能套用到 Mac;但它提醒兩點:第一,生成速度會直接改變使用感受;第二,功能愈多不一定愈適合第一隻本地 model。

由安裝到第一輪使用:跟這個次序做

由於資料未提供可核實的 Mac 安裝命令,安裝 Ollama 時應以其當前官方安裝頁所列步驟為準,避免照抄來源不明的指令。完成安裝後,可按以下流程建立第一輪測試。

  1. 先關閉不必要的重型程式,尤其是大量分頁、影像編輯或其他會長期吃記憶體的工具。目的是讓你量度的是 model 的表現,而不是一部本來已經很忙的電腦。

  2. 在可選 model 中,先選一個 4B 級文字 model。若你只想做文字摘要、改寫或腦力激盪,不要為了「可能有用」而一開始便選帶有額外視覺組件的選項。

  3. 用 Ollama 提供的命令列介面或圖形介面載入 model,然後以三至五條固定問題測試。例如:把一段你可公開使用的文字濃縮成要點、把一段說明改成較清楚的中文、解釋一個熟悉的概念,以及為一個題目列出提綱。固定題目才容易比較之後換 model 的差異。

  4. 每次只改一個因素。先保持同一 model、相近的問題長度和同一批背景程式;若想比較另一隻 model,才更換 model。否則你很難分辨慢是由 model、長對話,還是其他程式造成。

  5. 觀察三件事:首次開始回答要等多久、回答期間能否正常切換其他程式、以及答案是否足以完成你的工作。若最後一項不合格,單靠忍受更慢速度未必值得;若第二項不合格,先縮小 model 或減少背景工作會較合理。

用途決定 model,而不是反過來

本地 model 特別適合把工作拆成小而清楚的單位:整理筆記、改寫草稿、從已知材料抽出重點、產生幾個構思方向。這類任務容許你先看輸出再修訂,也較容易用短對話完成。相反,涉及重要事實、專業判斷或會造成實際後果的內容,仍應自行核對原始資料;本地運行不會令模型自動變得準確。

若你的目標是長篇、複雜或多輪推理,先問自己是否真的需要在本機完成。把一個大問題拆成數個短任務,往往比硬推一隻更大 model 有效率:先請它列綱要,再逐段改寫,最後由人手覆核。這也會減少對話愈積愈長所帶來的資源壓力。

何時應升級記憶體或改變期望

當你已使用 4B 級 model,並清理背景程式後仍常見系統明顯卡頓、首字等待很久,或日常工作被迫中斷,瓶頸很可能不只是 model 本身。這時不應把「下載更大 model」視為唯一解法。先確認你是否經常同時開啟大量程式、是否真正需要視覺功能、以及工作能否拆細。

購買新 Mac 時,也不要只把記憶體視為規格表上的一行。TechCrunch 曾報道記憶體晶片供應緊張已影響 MacBook Air 的供應,但該報道沒有提供香港售價、供貨或配置資料,故不宜據此推斷本地購買情況。對有本地 LLM 需要的人來說,較值得思考的是:這部機是否還要同時處理剪片、設計、開發或大量瀏覽器分頁;若是,留出更多記憶體餘量通常比只追求「勉強跑到最大 model」更符合長期使用。

總結而言,16GB 跑本地 LLM 的實際答案不是某個保證可行的最大數字,而是:先以 4B 級 model 建立穩定、可重複的文字工作流程。它能完成你常做的任務,回應速度又不妨礙日常使用,才叫做跑得值得;若唔係,再大的 model 也只是規格上的勝利。

延伸閱讀

AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。


參考來源

資料及操作介面可能隨版本更新;本文以列明來源的資料範圍為準。

分享:WhatsAppThreadsTelegramFacebook