Claude Code 太貴?多個本地細模型分工,慳錢之前要計清楚硬件同時間
3C 產品

Claude Code 太貴?多個本地細模型分工,慳錢之前要計清楚硬件同時間

圖片:via XDA Developers — https://www.xda-developers.com/replaced-claude-code-tiny-specialists-boring-setup-worked-better/
TechLab 編輯部(譯)·

XDA 作者用 n8n 配 Ollama,將簡單工作拆畀四類 Qwen 模型

XDA 作者 Anurag Singh 用 Claude Code 整個人項目時,發現大量 token 花咗喺搵檔案、讀錯誤紀錄、改依賴套件同跑測試呢類工作。佢索性用 n8n 做流程控制、Ollama 跑本地模型,將工作拆開交畀幾個細模型。咁樣令佢唔使再成日擔心 token 成本,出錯時亦較易搵到問題出喺邊。不過原文冇公開測試項目、完成時間、成功率同硬件,唔足以證明呢套組合寫程式勁過 Claude Code。

四類模型,各自只做一小截

成套設定由 Qwen 3.5 2B 做 routing,按任務揀合適工具同專職模型;Qwen 2.5 Coder 7B 負責睇同改程式碼;幾個共用 Qwen 3.5 9B 嘅 worker 分別處理資料搜集、Python/SQL 同自動化;最後由 Qwen 3.5 4B 對照成功條件驗收。程式碼要通過測試,研究結果要跟來源,失敗最多重試兩次。套流程穩定咗,主要係因為每個模型權限清楚、會按工具實際回傳嘅結果做判斷,而且重試次數有上限;用幾多個模型反而唔係重點。

作者列出嘅量化模型檔大約由 2.7GB 至 6.6GB,最大嗰個係 Qwen 3.5 9B;Qwen 2.5 Coder 7B Q4 就約 4.7GB。不過檔案大小唔等於實際 RAM 或 VRAM 用量,長 context、KV cache、同時載入幾個模型同 n8n 本身都會再食記憶體。Ollama 官方亦講明,coding agent 建議至少用 64K context,而 context 愈長就佔愈多記憶體。原文冇交代電腦設定,所以 8GB、16GB 定 32GB 先跑得順,暫時冇可靠答案

Claude Code 太貴?多個本地細模型分工,慳錢之前要計清楚硬件同時間

圖片:Wikimedia Commons — Marine BAJAN(CC BY-SA 4.0)

安裝門檻高,速度亦未必一定快

Claude Code 官方要求只係 4GB RAM、網上連線同登入帳戶,裝好之後已經識讀專案、改檔同跑指令。XDA 呢套本地方案就要裝 Ollama、n8n、下載幾個模型、設定 routing JSON、工具權限、sandbox、驗收規則同重試流程。熟 Docker、API 同 automation workflow 嘅開發者應該砌得到,但只係間中寫程式嘅人,多數會嫌維護幾麻煩。模型更新、prompt 失效同 workflow 改壞咗,都要自己執手尾。

細模型完全放得入 GPU 時,回應有機會好爽;落咗 CPU,或者每步都要輪流載入模型,速度可以慢好多。再加上 routing、worker、驗收同重試本身係多個步驟,整項任務用時未必短過一次 Claude Code session。原文只話流程「做得好啲」,冇提供 tokens per second 或完成時間,所以現階段只能話 本地方案嘅成本較易預算,速度就睇硬件同流程點砌

私隱較易控制,但唔係裝完就自動安全

模型同 n8n 都喺自己部機跑,專案檔案可以留喺本地,呢點對有客戶程式碼或內部資料嘅細團隊幾實際。作者亦限制 coding worker 只可掂指定專案目錄同 sandbox terminal,research worker 冇改檔權限,自動化 worker 只可用核准咗嘅 n8n action。不過資料搜集仍然會連出網上,依賴套件、搜尋內容、n8n credential 同執行紀錄亦要自己保護。本地執行減少咗程式碼交畀模型供應商嘅機會,整體保安責任就落返開發者手上。

細模型適合有明確答案嘅工作

搵出控制某粒掣嘅檔案、按既有格式補測試、根據 error log 修一個細問題、跑 lint、整理資料,呢啲任務有清楚輸入同可驗證結果,7B 至 9B 模型確實有發揮空間。至於由模糊要求規劃整個項目、跨好多檔案重構、判斷架構取捨、處理安全敏感程式碼,作者自己都承認 Claude 仍然明顯可靠過每個本地模型。細模型一旦遇到錯誤測試、欠缺文件或專案暗規矩,兩次重試亦未必救得返。

Token 帳單換成硬件同設定時間

Anthropic 喺 2026 年 5 月公布,Claude Opus 4.8 標準 API 價係每百萬輸入 token 5 美元、每百萬輸出 token 25 美元;Claude Code亦可跟 Claude Pro 或 Max 月費計劃使用,唔係人人都逐粒 token 付款。本地模型就冇持續 API token 帳單,亦少咗美元付款同用量上限嘅麻煩,不過電力、GPU 或大記憶體電腦、設定時間同日後維護全部都有成本。已經有合適硬件、又長期跑大量細任務,呢盤數先較容易計得掂。

呢個案例值得學嘅地方係工作分級:日常、重複、測試到嘅工作先交畀本地細模型,需求含糊或者改動風險高先開 Claude。想照抄成套設定之前,最好先用自己常見嘅任務記錄完成時間、測試通過率同人手執漏時間;冇呢三組數字,「免費」同「做得好啲」都只係個人感受。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook