
用本地 LLM 代替 Claude Code:慳咗月費,邊類開發工作真係頂得上?
Continue 加 14B 模型夠做細改動,大型重構仍然差一截
XDA 作者 Anurag Singh 用咗 Claude Pro 大約半年,最後取消每月 US$20、約 HK$156 嘅計劃,改喺 VS Code 入面跑本地 LLM。佢揀嘅組合係 Continue extension、Docker Model Runner 同 Qwen2.5-Coder 14B。最大得着好直接:改錯可以再試,解釋同一段 code 幾次都得,唔使一路望住用量。呢個係作者個人工作經驗,原文冇統一任務、完成時間或者錯誤率測試,所謂「做多咗」暫時只可以當使用感受。
Claude Code 個限制確實存在,但未去到完全冇路行
Anthropic 官方資料確認,Claude Pro 仍然係每月 US$20,互動用量按五小時時段重設,另有每星期上限;實際可用幾多會受對話長度、檔案內容同模型影響。用完之後,而家亦可以開額外 usage credits,按量付費繼續用。所以原文形容限制近乎「用唔到」明顯帶住作者情緒,不過長對話同大 repository 食量快,做到一半要等重設,對開發節奏確實幾煩。Max 計劃用量高好多,月費亦跳到 US$100 起,個差距自然令本地方案吸引。

圖片:Wikimedia Commons — Marine BAJAN(CC BY-SA 4.0)
14B 模型要幾多硬件先跑得順
作者用 16GB unified memory 嘅 MacBook Air 跑 Qwen2.5-Coder 14B Q4,表示基本可用,但同時開 Docker 同其他食 RAM 工具就會幾逼,長時間運行部機亦會熱。Qwen 官方 Hugging Face 頁面列出 Q4_K_M 檔案約 8.99GB;連同 context cache、推理程式、VS Code 同開發環境,16GB 系統 RAM 可以視為呢套配置嘅實際入場線,唔算鬆動。PC 冇獨立 GPU 都可以靠 CPU 跑,只係慢好多;想主要放入顯示卡,按模型大小同額外記憶體開支估算,12GB VRAM 用落會穩陣過 8GB;8GB 卡通常要將部分資料放返落系統 RAM。
細一級嘅 7B 模型對 8GB 至 16GB RAM 機器友善啲,autocomplete 同單檔補碼亦會快啲,不過作者話一去到多個檔案就容易甩線。呢點同模型大小嘅取捨吻合,但原文冇公開固定測試集,唔可以當成硬件 benchmark。買新 GPU 專登慳每月約 HK$156,回本時間多數唔靚,仲未計電費;本身已有合適 Mac、遊戲 PC 或工作站,條數先容易計得過。
安裝唔複雜,離線程度就要自己執好
做法大致係先喺 Docker Desktop 開啟 Model Runner 同 TCP 存取,再下載模型同啟動佢;Docker 官方確認 OpenAI-compatible endpoint 可以放喺 http://localhost:12434/engines/v1。跟住喺 VS Code 裝 Continue,把本地 endpoint、模型名稱、context 長度同 chat、edit、apply 等角色寫入現行 config.yaml。Continue 官方亦建議將 autocomplete 交畀較細模型,14B 留返做對話同改 code,避免每打一兩個字都等大模型慢慢推理。
模型下載完成後,prompt、code 同回覆可以留喺部機,平時唔使連外部模型 API。不過裝 extension、下載模型同更新工具嗰陣仍然要上網;Continue 預設亦可能嘗試傳匿名 telemetry。要做到真正離線,官方指引係預先下載 VSIX、關閉「Allow Anonymous Telemetry」,再確認所有模型同依賴已放喺內網或本機。公司 code 有私隱要求嘅話,仲要檢查 VS Code 其他 extension、package manager 同 terminal command,淨係換走模型 API 未包晒成條資料路徑。
補碼同細修正啱用,大型 agent 工作差距仍然明顯
日常任務例如解釋 function、補 test case、改一個 component、跟住清楚 error message 修 bug,本地 14B 模型有足夠 context 就幾有用。Continue 可以提供檔案搜尋、修改同 terminal 工具,亦可以將 repository 規則、測試指令同禁改檔案放入 .continue/rules/。但 介面有 Agent mode,唔代表個模型就有 Claude Code 嗰種判斷力。Continue 官方寫得好清楚,Agent mode 要模型真正支援 tool calling;設定檔加上 tool_use 只係話畀 extension 知有呢項能力,模型本身做得唔穩,工具呼叫一樣會出錯。
跨十幾個檔案重構、追一條唔清楚嘅 bug、自己決定跑邊組測試,再按失敗結果改方案,正正係本地細模型最易失手嘅位置。作者亦承認 Qwen2.5-Coder 14B 理解大型專案慢過 Claude、錯誤多啲,prompt 要寫得具體好多。就算現有測試全部過關,都仲要人手 review,睇吓模型有冇漏改 call site 或整壞邊界情況。小型團隊較穩陣嘅用法係畀本地模型處理大量低風險細任務,遇到模糊需求、大型改動或者多次失敗先轉用較強嘅雲端 agent,咁先真正減到訂閱用量同等待時間。
參考來源
- XDA Developers — I ditched Claude Code's $20 plan for a local LLM in VS Code, and I'm getting more done — original report
- What is the Pro plan? — Anthropic 官方資料,核實 Claude Pro 月費、五小時用量時段同額外 usage credits。
- Continue config.yaml Reference — Continue 官方設定參考,核實模型角色、tool_use 同 Agent mode 嘅關係。
- How to Run Continue Without Internet — Continue 官方離線指引,核實 VSIX、匿名 telemetry 同本地模型設定。
- Docker Model Runner REST API — Docker 官方文件,核實本機 port、OpenAI-compatible endpoint 同 TCP 存取設定。
- Qwen2.5-Coder-14B-Instruct-GGUF — Qwen 官方模型頁,核實參數量、context、量化格式、Q4 檔案大小同本地啟動方法。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







