Claude Opus 5 半價逼近 Fable 5,Claude Code 用家點揀 effort 先抵
Tech News

Claude Opus 5 半價逼近 Fable 5,Claude Code 用家點揀 effort 先抵

圖片:via iThome — https://www.ithome.com.tw/news/177643
TechLab 編輯部(譯)·

效能差距集中喺部分測試,實際慳幾多要睇任務同 token 用量

Anthropic 喺 7 月 24 日推出 Claude Opus 5,定位係日常高階 coding agent 同知識工作模型。佢而家係 Claude Max 嘅預設模型,亦係 Pro 方案提供嘅最強選項。重點係同 Opus 4.8 收費一樣,但處理長任務、除錯同跨工具工作嘅能力升咗一截,令 Fable 5 未必再係每次遇到難題都要開嘅選擇。

「半價接近 Fable」有清楚界線

根據 Anthropic 公布嘅 CursorBench 3.2 數字,Opus 5 喺 max effort 得 70.0%,Fable 5 就係 70.5%;每項任務平均成本分別係 8.23 美元同 17.32 美元。iThome 報道所講嘅「成本減半」,主要就係建基於呢組比較。呢個結果只代表指定 coding agent 測試,唔等於 Opus 5 喺所有任務都同 Fable 5 同級,仲唔代表每個用戶張單都會平一半。

官方亦話 Opus 5 喺 Frontier-Bench、GDPval-AA、OSWorld 2.0 同 AutomationBench 等測試表現突出,涵蓋寫程式、專業知識、電腦操作同跨 app 任務。不過成批結果都由 Anthropic 提供,部分仲用內部測試設定,暫時未見大規模獨立重跑。現階段較穩陣嘅解讀,係 Opus 5 嘅性價比曲線向前推咗,Fable 5 仍然留畀最長、最難同失敗代價最高嗰批工作。

由復古蛋形圖案砌成數字 5 嘅 Claude Opus 5 官方發布主圖

圖片:Anthropic

effort 先係控制開支嘅實用掣

Opus 5 支援 low、medium、high、xhigh 同 max effort,Claude API 同 Claude Code 預設用 high。官方建議先由 high 開始,再按自己嘅測試結果調整;low 同 medium 適合日常修改、初步 code review 同資料整理,xhigh 就用喺大型重構或長時間 agent 任務。effort 控制模型諗幾耐同用幾多 token,唔會穩定咁縮短最後答案,想佢答得短仍然要喺 prompt 講明。

呢個設計亦解釋咗點解單睇每百萬 token 價錢唔夠。Agent 會反覆讀檔、叫工具、跑測試同修正錯誤,任何一環多轉幾次,總成本已經可以差好遠。Opus 5 驗證成果同分派子任務都主動過上代;如果原有 prompt 已經叫佢重複檢查,或者每次都開幾個子 agent,反而可能白花 token。Anthropic 嘅 prompt 指引都建議刪走多餘嘅覆核步驟,細任務亦要限制分派數量。

Anthropic 比較 Opus 5、Fable 5 等模型喺不同 effort 下 Frontier-Bench 成績同成本嘅圖表

圖片:Anthropic

Claude Code 用家應唔應該即轉

用緊 Opus 4.8 嘅 API 或 Claude Code 用戶值得先試 Opus 5,因為標準 API 價維持每百萬輸入 token 5 美元、輸出 token 25 美元,舊 prompt 一般亦可以直接沿用。做大型 feature、跨檔案重構、追查深層 bug 同 code review,升級價值會較明顯;改幾行設定、寫測試骨架或整理文件,就可以留喺 high 以下,甚至切返 Sonnet 5,慳返反應時間同用量。

Max 用戶會直接遇到 Opus 5 成為預設模型,長時間用 Claude Code 嗰批人最容易感受到分別;Pro 用戶就要留意方案用量,唔好每個簡單問題都推到 max。API 團隊最好揀一批自己真係會做嘅任務,逐級跑 low 至 xhigh,比較成功率、總 token、工具調用次數同完成時間,咁先計到邊級 effort 最抵。

Anthropic 公布 CursorBench 成績同每項任務成本比較圖,Opus 5 最高 effort 接近 Fable 5

圖片:Anthropic

Fable 5 仲有位置,但價錢以外亦有取捨

Fable 5 嘅 API 定價係 Opus 5 兩倍,每百萬輸入同輸出 token 分別收 10 美元同 50 美元,官方定位仍然係處理最高難度、可以連續運行多日嘅 agent 任務。一般使用 Fable 5,資料最少要保留 30 日;Opus 5 就冇同類要求。公司處理敏感程式碼或文件時,呢個差異可能比 benchmark 相差半分更值得留意。

至於香港用戶,Anthropic 截至 7 月 27 日嘅公開支援地區名單未見香港,香港帳戶實際有冇 Opus 5、提供邊種方案同點樣結算都係 [待確認],所以唔宜寫死港幣月費。已經喺帳戶見到模型嘅用戶,可以先用預設 high 跑幾個常用任務;開發團隊就應該按美元 API 價同自己嘅任務紀錄計數,咁樣會貼近實際情況過直接照搬官方「半價」說法。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook