Claude Opus 5 點用先抵:Coding、長文件同 Agent 選模成本實戰
Tech News

Claude Opus 5 點用先抵:Coding、長文件同 Agent 選模成本實戰

圖片:via TechNews 科技新報 — https://technews.tw/2026/07/29/claude-opus-5/
TechLab 編輯部(譯)·

日常工作交畀 Sonnet,複雜任務先升級,token 費可以差一截

Claude Opus 5 喺 7 月 24 日推出,定位係複雜 coding、長時間 agent 同企業工作。Anthropic 話 Opus 5 喺多項 coding 同知識工作評測入面,表現貼近價錢貴一倍嘅 Fable 5;Artificial Analysis 嘅第三方評測亦顯示,Opus 5 max 表現排喺前列。不過模型強唔代表每個 prompt 都值得開盡,尤其 agent 每行一步、每叫一次工具、每次重試,都可能繼續燒 output token。

TechNews 科技新報報道整理咗 Opus 5 嘅 effort、prompt 寫法、Claude Code 記憶同 Skill 功能。當中最值得抽出嚟講嘅,其實係模型分流:先按失敗代價、任務長度同判斷難度揀模型,再調 effort。淨係因為文件長、code 多或者問題聽落專業就直上 Opus,通常只係買貴咗嘅答案。

四類工作點分流

一般問答、改寫、分類同格式轉換,用 Haiku 4.5 或 Sonnet 5 low 已經合理。單檔修正、已知錯誤、規格清楚嘅小功能,可以由 Sonnet 5 medium 開始;如果牽涉多個模組、要追 root cause、重構後仲要自己跑測試同修正,先轉 Opus 5 high。Opus 5 嘅價值通常喺長鏈工作先見到,改三行 CSS 或寫一封電郵,用佢好易變成大材小用。

長文件分析亦唔等於指定 Opus。 Opus 5 同 Sonnet 5 都有 100 萬 token context,同樣支援最高 128k token 輸出。純摘要、抽欄位、按章節分類,可以先交畀 Sonnet;要對照多份合約、搵出互相矛盾嘅條款、核對數字同推論,或者整合成有取捨嘅決策文件,Opus 先較有機會值回票價。Context 裝得落只代表模型收得到,唔保證每個細節都判得啱。

Agent 任務就睇錯一步有幾貴。 整理資料、批量改名、讀取狀態呢類可逆工作,用 Sonnet 配明確工具限制較化算;跨多個系統、要長時間維持目標、處理含糊規格,或者錯誤會影響 production,先考慮 Opus high。xhigh 留畀普通設定確實做唔掂嘅長程 coding,max 則應該有自家測試證明佢真係提高成功率先開。Anthropic 官方亦建議由 high 起步,再按實際評測升降。

Anthropic 發布 Claude Opus 5 嘅官方主視覺

圖片:Anthropic

價錢差幾遠?

截至 2026 年 7 月 29 日,Opus 5 API 每 100 萬 input/output token 收 US$5/US$25;Sonnet 5 優惠期至 8 月 31 日係 US$2/US$10,之後回復 US$3/US$15。Haiku 4.5 係 US$1/US$5,Fable 5 就係 US$10/US$50。GPT-5.6 Sol 官方價係 US$5/US$30,單價同 Opus 接近,實際選邊個應用同一批工作測成功率、延遲同總 token,唔好只睇一次 benchmark。

假設一個 coding 任務讀入 50,000 token,再產生 5,000 token,Opus 5 約 US$0.375;Sonnet 5 優惠價約 US$0.15,正價約 US$0.225;Fable 5 就約 US$0.75。換成一批 200,000 token 文件、輸出 5,000 token,Opus 約 US$1.125,Sonnet 優惠價約 US$0.45。呢啲只計一次 API 請求,未計搜尋、code execution、agent 多輪工具操作、重試同失敗後返工,實際帳單可以高好多。

慳 token 最有效嘅幾招

第一輪先用 Sonnet 判斷工作類型,抽出相關檔案或章節;真係卡住,先整理好材料再交畀 Opus。重複使用同一份大型規格或 codebase 前綴,就開 prompt caching;Opus cache read 只收每 100 萬 token US$0.50,遠低過普通 input 嘅 US$5。Agent 亦要限制子 agent 數量、工具步數同可改動範圍,避免一個細任務拆成幾條同時燒 token 嘅支線。

Effort 控制思考量,唔會可靠地縮短畫面上見到嘅答案。想控制篇幅,要直接寫明輸出格式、字數同要幾多個重點。Opus 5 預設開咗 thinking。官方建議由 high 起步,再按自家評測調整;如果 low 或 medium 已經保得住質素,就可以用佢哋慳成本。xhighmax 亦唔容許關閉 thinking。Artificial Analysis 嘅 GDPval 測試入面,Opus 5 由 low 升到 max,output token 用量相差約八倍,正好說明 effort 開盡有實際代價。

強模型一樣會答錯

Artificial Analysis 嘅獨立評測顯示,Opus 5 max 整體能力貼近 Fable 5,不過佢喺事實知識測試仍落後 Fable,測得嘅幻覺率亦高過 Opus 4.8。呢類綜合 benchmark 只係參考,未必代表你公司嗰套文件、語言同工具流程。涉及合約、財務、production code 或不可逆操作,仍然要保留來源核對、測試同人工批准,唔好用較高 effort 代替驗證。

最實用嘅設定係 Sonnet 做預設、Opus 處理已證明困難嘅工作,再按每類任務記錄成功率同平均成本。跑一兩星期真實工作量之後,邊啲任務值得升級,通常會清楚過任何官方排行榜。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook