Claude Opus 5 用半價 API 逼近 Fable 5,Claude Code 日常點揀
3C 產品

Claude Opus 5 用半價 API 逼近 Fable 5,Claude Code 日常點揀

圖片:via MacRumors — https://www.macrumors.com/2026/07/24/anthropic-opus-5/
TechLab 編輯部(譯)·

官方跑分好睇,第三方 code review 測試就未有一面倒結果

Anthropic 推出 Claude Opus 5,定位幾清楚:用 Opus 4.8 嘅價,提供接近旗艦 Fable 5 嘅能力,俾人每日長開都冇咁肉赤。佢而家係 Claude Max 預設模型,亦係 Claude Pro 方案內最強選擇。對用 Claude Code 做開發嘅人,今次值得睇嘅位主要係成本同穩定性;Opus 5 直接壓縮咗 Fable 5 同舊 Opus 之間嘅空間。

官方跑分確實升得幾大

Anthropic 公布嘅 benchmark 入面,Opus 5 喺 Frontier-Bench v0.1 agent coding 得到 43.3%,高過 Fable 5 嘅 33.7%同 Opus 4.8 嘅 21.1%;DeepSWE v1.1 就係 68.8%,貼住 Fable 5 嘅 69.7%,亦明顯高過 Opus 4.8 嘅 59.0%。OSWorld 2.0 電腦操作測試方面,Opus 5 有 70.6%,Fable 5 同 Opus 4.8 分別係 66.1%同 55.7%。

呢批成績全部來自 Anthropic 公布嘅測試或發布夥伴提供嘅 eval,唔可以當成日常開發結果。以 Frontier-Bench 為例,官方註明用指定 agent harness、backend,同一題跑五次取平均,安全分類器擋住時亦會轉交 Opus 4.8。CursorBench 所講嘅「距離 Fable 5 最高分只差 0.5%」,仲要開到 max effort 先做到,prompt、工具同 effort 設定轉一轉,差距可以完全唔同。

多款復古蛋形插畫砌成數字 5,係 Claude Opus 5 官方主視覺

圖片:Anthropic

「半價」只係 API token 定價

Opus 5 API 定價係每百萬 input token US$5、output token US$25,同 Opus 4.8 完全一樣;Fable 5 就係 US$10 同 US$50,所以逐粒 token 計真係平一半。假設一次工作用一百萬 input token,再輸出二十萬 token,Opus 5 或 Opus 4.8 收 US$10,Fable 5 收 US$20,未計 prompt caching 或其他平台費用。

不過實際賬單仲要睇模型食幾多 token、重試幾多次,同幾快完成工作。官方所講嘅半價,有時係同一 benchmark 每項任務嘅成本,有時係單純比較 API rate,唔代表 Claude Pro 或 Max 月費減半。Fast mode 約快 2.5 倍,但收費係基本價兩倍;趕住等 agent 出結果先有理由開,普通背景工作未必抵。

Anthropic 官方圖表比較 Opus 5、Fable 5、Opus 4.8 同 GPT-5.6 Sol 多項 benchmark 成績

圖片:Anthropic

獨立測試暫時未有一面倒結果

Opus 5 發布時間仲短,第三方資料未算多。CodeRabbit 拎咗約 100 個真實開源 pull request 入面嘅錯誤做測試,每個設定跑三次,發現 x-high effort 嘅 actionable comment precision 有 39.3%,高過佢哋 production baseline 嘅 35.2%;但已知問題捕捉率得 55.2%,baseline 就有 61.1%,低價值 nitpick 數量亦多約四倍。呢個係 code review 特定流程,唔代表所有 coding 工作,不過足以提醒大家:諗耐啲未必每項指標都好啲。

CodeRabbit 早期觀察亦話,Opus 5 做 builder 好過做唯一 reviewer。佢處理方向模糊、設計成分重嘅大型任務時,判斷力好過 Opus 4.8;但速度同 token 效率仍落後 Fable 5。佢哋同一輪 review 入面,Opus 5 平均讀取約 60,500 token、輸出約 9,500 token,分別多過 production baseline 約五成同六成半。平幾多要用自己嘅 repository 同任務量度,睇標價推算會好易失準。

Claude Code 日常應該點揀

Pro 用戶直接由 Opus 5 開始最合理。 多檔案修改、追難捉 bug、規劃重構,同要 agent 自己驗證結果嘅工作,都啱用佢。Max 已經預設 Opus 5,日常同樣可以照用;遇到跨大型 codebase、要行好多輪工具、失敗重跑成本極高嘅長任務,先升去 Fable 5。兩款都有一百萬 token context window同 128,000 token 最大輸出,兩者主要差喺能力上限、速度同成本。

經 API 跑 agent 嘅團隊,可以將 Opus 5 設成複雜工作預設,再按自己 eval 將最難嗰批升去 Fable 5。Opus 4.8 價錢冇優勢,主要用途會剩返固定舊版結果、做 regression 對照,或者由安全機制自動 fallback。Opus 5 喺 Claude Code 同 API 預設用 high effort,簡單改字、補測試或格式整理可以調低 effort,慳 token 往往實際過盲目轉用舊模型。

網上安全能力要分清楚兩件事

Anthropic 話 Opus 5 搵軟件漏洞嘅能力接近 Mythos 5,但實際利用漏洞發動攻擊嘅能力仍落後一大截,而且模型冇針對網上攻擊任務訓練。一般 Claude、Claude Code 同 Cowork 遇到分類器標記嘅要求,預設會轉交 Opus 4.8;API 開發者亦可以啟用自動 fallback。呢部分同樣係官方安全評估,未有足夠公開獨立結果支持更廣泛結論。

Opus 5 最吸引嘅地方係同 Opus 4.8 同價,但官方數據已經去到貼近 Fable 5。日常 coding agent 先用 Opus 5、難題先升 Fable,會係而家最實際嘅分工;正式搬 production workload 前,最好用自己常見任務跑一輪成功率、耗時同總 token 成本。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook