
Claude Code 模型揀得少反而易用?Sonnet、Opus、Haiku 點分工
三個模型家族夠做大部分 coding,代價係少咗跨供應商彈性
模型選單愈長,開工成本愈高
而家打開 AI coding 工具,未寫 prompt 已經要揀模型:邊個寫 code 穩、邊個推理深、邊個快、邊個慳 token,隔幾個星期答案又可能轉。XDA 作者 Mahnoor Faisal 覺得 Claude Code 吸引嘅地方,正正係佢冇擺成排供應商喺面前,每次開工少一道選擇題。呢個觀察有道理,不過始終係個人經驗,亦唔足以證明 Anthropic 模型做所有 coding 任務都贏。

圖片:Anthropic
少選擇真正慳嘅係切換成本
揀模型花嗰幾秒唔算多,麻煩係每款模型都有自己嘅做事方式:有啲會大手改 code,有啲偏向先問清楚,有啲推理耐但執行慢。轉一次模型,開發者往往要重新調整 prompt、權限同檢查力度。Claude Code 將選擇收窄到自家模型,日常可以沿用同一套習慣;Anthropic 同時控制模型同 coding harness,工具、context 管理同模型行為亦較容易夾好。少咗模型要比較,開工時亦唔使成日重新適應。
Sonnet 做日常主力,唔使一開波就上最重型
Anthropic 官方將 Sonnet 定位做大部分 coding 工作嘅預設選擇,速度、能力同成本取向較平均。功能已有清楚規格、補測試、修已知 bug、整理局部模組,通常由 Sonnet 開始最實際。操作上先講明要改邊幾個檔案、邊啲位置唔好郁,再列出驗收條件同要跑嘅測試。做咗兩輪仍然搵錯方向,或者發現問題牽涉多個系統,先升級模型,會慳過全程開住重型選項。
Opus 留畀架構、疑難 bug 同大型重構
Opus 適合問題未定形、要追好多層因果,或者改動橫跨多個服務嗰類工作,例如設計 migration、查間歇性 concurrency bug、評估大型重構路線。官方亦提醒 Opus 會明顯食多啲用量,所以唔建議長開。Claude Code 提供 opusplan 模式,用 Opus 諗方案,再交 Sonnet 執行,而對話內容會保留。早段用 Opus 定好方向,可以減少 Sonnet 執行期間行錯路同返工。
Haiku 做窄而機械化嘅工作
Haiku 主打快同慳,啱做 quick lookup、簡單改名、補 log、解釋短段 regex、批量處理格式,或者規格已經鎖死嘅小改動。用佢時最好將範圍收得好窄,列明檔案、輸出格式同檢查指令,唔好交一個含糊嘅安全修正或者大型 migration 畀佢自行理解。平模型一旦估錯方向,重做幾輪一樣會燒時間同 token;所以 Haiku 較適合範圍清楚嘅細項;任務含糊或者牽涉面廣,就未必真係慳到成本。
多模型工具仍然有實際價值
Claude Code 嘅簡潔亦有代價:團隊冇得隨時轉用 OpenAI、Google 或其他供應商嘅模型,遇上特定語言、超長 context、價格變動、服務故障或者公司採購限制,彈性會細啲。Cursor 呢類工具提供跨供應商選擇,亦有 Auto 模式幫手揀可靠模型,證明多選項可以靠 routing 收埋。至於 benchmark,CursorBench 雖然用真實多檔案任務評分,結果仍然只代表一套測試環境,唔等於某個模型會啱晒每個 codebase。
一套夠實際嘅分工方法
日常可以固定由 Sonnet 開始;範圍大、原因未明或者決策代價高,就先用 Opus 規劃;批量而機械化嘅細項先交 Haiku。每個新任務用 /clear 清走無關對話,長 session 就用 /compact 收細 context,再用 /model 核對帳戶當刻有咩模型。Anthropic 明講模型版本同供應情況會變,終端顯示先係準確名單。Claude Code 呢套取向最啱想固定工作節奏嘅開發者;要跨供應商逐項揀最強模型嘅團隊,較開放嘅工具仍然實際啲。
參考來源
- XDA Developers — Claude Code gives me very few models to work with, and that's exactly why I keep going back to it — original report
- Models, usage, and limits in Claude Code — Anthropic 官方講解 Sonnet、Opus、Haiku 分工、模型切換、用量同 context 管理
- Claude Code by Anthropic — Claude Code 官方產品定位同功能資料
- Cursor Models — 核對跨供應商模型選擇、Auto 模式同用量計法,補充少選擇以外嘅做法
- How we compare model quality in Cursor — 了解 CursorBench 點樣用多檔案真實任務評估 coding agent,同交代 benchmark 限制
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







