本地 LLM 寫 code 未必輸:細任務靠測試把關,私隱同成本要另計
3C 產品

本地 LLM 寫 code 未必輸:細任務靠測試把關,私隱同成本要另計

圖片:via XDA Developers — https://www.xda-developers.com/trusted-my-local-llm-with-everything-except-my-code-and-had-it-exactly-backwards/
TechLab 編輯部(譯)·

由解錯、單元測試到私人 codebase,拆開本機同雲端 agent 嘅實際分工

XDA 作者 Joe Rice-Jones 原先將摘要、資料搜集同解釋錯誤交畀本地 LLM,寫 code 就留返 Claude、Codex 呢類雲端工具。試咗一星期之後,佢反而將 Qwen3-Coder-30B-A3B 放入 editor:研究答案會漏資料、甚至講出唔存在嘅來源,細規模 coding 任務答錯,就容易俾測試即刻捉到。呢次經驗講到嘅,其實係點分配任務,唔足以證明本地模型寫 code 勁過雲端模型。

錯咗有幾易捉,影響個任務值唔值得交畀模型

程式碼有個好實際嘅優勢:compiler、type checker、lint、單元測試同現成測試套件都可以即場驗貨。叫模型修一個範圍清楚嘅 bug、按現有行為補測試、改細段重複 code、砌 regex、分析 stack trace,通常都有明確輸入同過關條件。模型寫錯 code,測試通常會即刻報錯;研究摘要就麻煩得多,句子可以讀落好順,但漏咗一份關鍵文件,未必即刻有人知。

不過,有測試唔代表可以盲批改動。模型可能寫出只驗證自己實作、完全捉唔到 regression 嘅測試;解釋錯誤訊息亦可能揀錯根因。比較穩陣嘅用法係先畀完整 log、相關檔案同重現步驟,再叫模型提出細改動,最後由測試、靜態分析同人手 review 一齊把關。涉及付款、權限、加密或者資料刪除嘅 code,review 門檻亦要再提高。

私人 codebase 係本地推理最實際嘅理由

Freelancer、開發公司同中小企成日會掂客戶程式碼、設定檔、內部 API 文件,將推理留喺自己部機,確實可以減少資料傳去第三方 server。不過「模型本地跑」唔等於成套環境離線安全。VS Code 官方講明,第三方 extension 可以自行收集使用資料,唔受 VS Code 個 telemetry 開關控制;Continue 嘅離線指引亦特別叫用家另外關掉匿名 telemetry。Git remote、套件工具、crash report 同 agent 接駁嘅其他服務,一樣要逐項檢查。

所以公司考慮本地 LLM 時,唔應該淨係問模型檔案放喺邊。要先畫清楚 prompt、code、索引、log 同 tool output 會經過邊啲軟件,再核對 extension 設定、網上連線、存取權限同客戶合約。真係要隔離敏感項目,可以用獨立帳戶、container 或 VM,封鎖不必要網上連線;單靠 UI 寫住「local」,資料管治上交代唔到幾多。

256K context 同 tool calling,紙面有唔等於用得盡

Qwen 官方列出 Qwen3-Coder-30B-A3B 支援 256K context,亦有 function calling,不過本機實際食到幾長,要睇量化版本、記憶體同 KV cache。就算成個 repo 塞得入去,模型亦未必識得揀啱檔案。工具調用仲要靠推理 server、parser 同 editor agent 配合;Qwen 自己都指定 SGLang、vLLM 要用相應 parser。Coding agent 嘅能力係模型、context 管理、工具同重試機制加埋嘅結果,淨睇模型名稱會高估實際表現。

呢點亦解釋咗雲端 agent 點解處理模糊需求、大型跨檔案重構、反覆跑指令同失敗復原時通常穩陣啲。SWE-bench 官方榜亦會分開模型同 agent scaffold 比較,反映同一個模型換咗工具層,結果都可以有明顯差距。相反,單一檔案、改動細、驗收條件清楚嘅任務,細模型已經有機會慳到雲端 token,又唔使等 rate limit。

本機冇逐 token 收費,但部機、電同熱都要計

本地推理可以避開 API 按量收費,上唔到網亦照用,敏感 code 又少一段外傳路徑;代價係先買硬件,再承擔用電、散熱、維護同等模型生成。香港住宅空間有限,高階 GPU 工作站嘅噪音同熱力唔係小事,電價亦會跟用量級別同燃料調整費變動。只係間中叫 agent 改幾段 code,雲端訂閱往往容易計數;每日長時間跑私人項目,本地硬件先較容易攤薄成本。

實際分工可以好簡單:私人而且容易驗證嘅細改動先交本地模型;需求含糊、牽涉大量檔案、要長時間自主調工具嘅工作,就用合適資料條款嘅雲端 agent。無論行邊邊,先跑測試、限制改動範圍,再由人批核 commit。之後真正值得比較嘅,係同一批日常任務喺固定硬件、固定 agent 同固定測試下,要改幾多次先過關。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook