Claude Code 唔使包辦晒:本地 Qwen 配雲端 supervisor 真係快兩倍?
3C 產品

Claude Code 唔使包辦晒:本地 Qwen 配雲端 supervisor 真係快兩倍?

圖片:via XDA Developers — https://www.xda-developers.com/ditched-claude-code-local-model-cloud-supervisor-twice-fast/
TechLab 編輯部(譯)·

強模型負責拆題同驗收,細模型留喺電腦執行細改動

XDA 作者 Anurag Singh 試咗一套幾實際嘅 coding agent 分工:先交畀雲端 GPT-5.6 Terra 理解問題、圈出相關檔案同寫清驗收條件,跟住由本地 Qwen3-Coder-30B-A3B 改 code、跑指令同測試,最後再畀 Terra 睇 diff。佢話處理日常細修正同小功能時,由落指令到通過 review,大約只用原先一半時間,雲端 token 用量亦少咗。

呢個「快兩倍」要睇清楚點計。作者量度嘅係整項任務完成時間,唔係兩個模型逐 token 鬥速度;本地模型可以連續改幾輪再測試,途中唔使每一步等雲端回應,llama.cpp 亦可以重用已有 prompt context。不過原文冇交代總共試咗幾多項任務、用咩電腦、兩邊首次成功率、平均要返工幾多次,亦冇同一組固定題目嘅對照結果。所以倍數只反映作者自己嗰批工作,未算得上 benchmark。

邊啲工夫適合交畀本地模型

作者揀嘅例子都有清楚邊界,例如修正 validation bug、加一個細選項,或者更新幾個相關測試。雲端模型預先消除大部分含糊位,本地 Qwen 只要沿住計劃改指定範圍,再用測試確認結果。呢類工作通常重複讀檔、改幾行 code、重新跑同一批指令,未必值得每一步都動用推理較慢、用量較貴嘅強模型。

相反,如果連問題源頭都未搵到、改動會牽涉架構,或者要由零開始設計新功能,作者仍然會用 Claude Code。佢亦為本地 agent 設咗停手條件:連續失敗、要改架構,或者超出原定範圍,就交返畀雲端模型。實際用嗰陣要定清楚停手條件;細模型連續做唔到,就應該交返畀人或者強模型,否則返工時間可能多過慳到嘅 token。

Claude Code 唔使包辦晒:本地 Qwen 配雲端 supervisor 真係快兩倍?

圖片:Wikimedia Commons — Marine BAJAN(CC BY-SA 4.0)

30B 模型唔等於普通手提電腦輕鬆跑

呢套設定用 llama.cpp 載入 Qwen3-Coder-30B-A3B-Instruct,再由 OpenCode 提供讀 repository、改檔同跑 terminal 指令嘅能力。Qwen 官方 model card 顯示,模型共有 305 億參數,但每個 token 只啟動 33 億,原生 context 上限係 262,144 tokens。MoE 架構可以減低每步運算量,不過完整模型權重仍要放得入記憶體,唔可以當佢只係一個 3.3B 模型。

XDA 用嘅 Q4_K_M GGUF 約 18.6GB,示範設定就將 context 收窄至 32K;KV cache 仲會額外食記憶體。16GB RAM 機要再降低量化精度同 context,速度同輸出質素亦可能跟住變。換句話講,雲端帳單的確有機會細咗,但成本會轉去 RAM、GPU、電力、下載容量同日後維護。手上已有大記憶體 Mac 或工作站會易試好多;為咗呢套做法特登換機,就要另計條數。

私隱有改善,但程式碼仍未完全離線

中間幾輪改檔、測試輸出同重複讀取嘅內容都留喺本機,對公司內部 repository 或客戶項目有吸引力。不過 Terra 開頭仍會收到 repository 概要同相關錯誤,完成後亦會睇最終 diff。私隱邊界取決於你實際送咗咩出去,唔可以因為執行模型喺本地,就當成套做法完全離線。

Claude 官方資料亦顯示,Claude Code 會同網頁及 app 共用訂閱用量池,用量受五小時滾動時段同額外週限額影響,實際消耗會跟對話長度、任務複雜度同所選模型轉變。混合分工確實有機會減少重複檔案內容同 terminal output 上雲,但節省幾多冇固定答案;模型版本、收費同限制轉一次,數字又要重新計過。

由低風險任務開始分級派工

細型團隊可以先由低風險任務試起:限定檔案範圍、要求現有測試先全部通過、喺獨立 branch 執行,遇到連續失敗即停,再由人或強模型 review diff。OpenCode 呢類 harness 可以畀模型直接跑 terminal,權限亦要收窄,唔好任由一個較細、較易走偏嘅模型接觸 production credential 或執行高風險指令。

呢套分工嘅重點係唔使每一步都用同一級模型。規劃、追查未知問題同 code review 留畀強模型;格式修改、指定範圍修正同測試迴圈就交畀本地模型。至於係咪真係快一倍,要用自己平日嗰批 issue 記錄完成時間、成功率同返工次數,跑過幾輪先有答案。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook