Claude Opus 5 搶做 coding agent 主力:接近 Fable,限制少好多
Tech News

Claude Opus 5 搶做 coding agent 主力:接近 Fable,限制少好多

圖片:via The Verge — https://www.theverge.com/ai-artificial-intelligence/970105/claude-opus-5-announced-anthropic-ai-model-release
TechLab 編輯部(譯)·

複雜開發能力升級,價錢維持不變,香港帳戶支援仍有缺口

Anthropic 推出 Claude Opus 5,定位係用較低成本提供接近 Fable 5 嘅能力,主攻複雜 coding 同長時間 agent 任務。Opus 5 已經喺 Claude API、Claude Code 同 Claude 產品推出,API model ID 係 claude-opus-5;Claude Max 會預設用佢,Pro 方案亦可以用到呢款最強 Opus。對日常寫 code、追 bug、重構大型專案嗰班人,升級重點落喺模型識唔識自己驗證、試多個方法,同埋做耐咗會唔會開始走樣。

對 Claude Code,真正有用係做事方式穩咗

Anthropic 公布嘅案例集中喺較難自動量化、但開發者日日撞到嘅問題:搵到 root cause 後有冇順手修埋邊界情況、改完介面會唔會自己開瀏覽器睇桌面同手機版、提交 PR 前有冇核對 branch、測試同模板。官方又話 Opus 5 喺 Frontier-Bench v0.1 嘅表現超過其他模型,得分亦高過 Opus 4.8 一倍以上。不過呢批數字主要由 Anthropic 同早期合作夥伴提供,未有獨立 Opus 5 大型測試,暫時應該當成產品方向,唔好直接當成實戰勝負表。

呢種提升對 coding agent 幾關鍵。短 prompt 生成一段 function,好多模型早已做得似模似樣;但跨十幾個檔案追依賴、途中處理新 feedback、跑測試再修正,先至最花時間。Opus 5 官方案例最常提到「先檢查再動手」同「做完自己驗證」,反映 Anthropic 今次改善嘅係 agent loop 入面嘅判斷同穩定性。呢方面如果經得起獨立測試,Claude Code 用家會少啲睇住個 agent 做到一半突然自信收工。

Anthropic 公布嘅 Opus 5 自動行為審核比較圖

圖片:Anthropic

同 Fable 5 接近幾多,要睇工作類型

Anthropic 話 Opus 5 喺 CursorBench 3.2 用最高 effort 時,距離 Fable 5 最佳成績少過 0.5%,每項任務成本大約只係一半;OSWorld 2.0 方面,官方更聲稱 Opus 5 用約三分一成本已超過 Fable 5 最佳結果。呢啲成績集中喺 coding、電腦操作同一般知識工作,未等於兩款模型全面睇齊。Anthropic 仍然把 Fable 5 定位為最高能力一級,適合最進取、運行時間最長嘅 agent 專案;Mythos 5 喺進攻型 cyber security 同部分科研任務亦明顯較強。

實際揀模型,可以先睇任務會唔會長期撞安全分類器。Fable 5 回歸後加咗好闊嘅 cyber safeguards,連正常 HTTP protocol 修正都有機會轉交 Opus 4.8。RuBench 研究團隊跑 25 個 repository 任務時,有 5 個 Fable 5 任務中途觸發 fallback,比例係 20%;研究規模唔大,亦測緊 7 月初嗰版 safeguards,但足以點出 product routing 對 coding agent 嘅干擾。你以為一路用緊 Fable,最後個 patch其實由另一款模型接手,能力比較同可重現性都會變得含糊。

Opus 5 同 Mythos 5 喺 OSS-Fuzz 搵漏洞及開發 exploit 嘅官方比較圖

圖片:Anthropic

Opus 5 限制少啲,安全工作流會順手啲

Opus 5 同樣會封鎖 binary vulnerability scanning、滲透測試同 exploit 生成,但容許模型喺 source code 入面搵漏洞。按 Anthropic 內部估算,佢嘅分類器介入次數會少過 Fable 5 約 85%。Claude.ai、Claude Code 同 Cowork 遇到攔截時會預設轉用 Opus 4.8;API 用家可以自行開啟 automatic fallback。對一般後端、網絡協定同安全修補工作,呢個差異可能實際過零點幾個 benchmark 百分點,因為 agent 少一次中途換腦,成段工作紀錄會完整好多。

以日常開發嚟講,Opus 5 可能比 Fable 5 實用。Fable 5 能力較高,但成本同安全限制都多;Opus 5 做 code audit 時限制少啲,能力差距亦收窄咗。官方同時話 Opus 5 搵漏洞嘅能力已貼近 Mythos 5,但將漏洞變成可用 exploit 時仍落後一截。換句話講,Anthropic 想保留防守用途,又喺高風險操作前收窄權限,取捨對正常開發者相對易接受。

標準價抵,Fast mode 就要重新計數

Opus 5 API 價錢維持 Opus 4.8 水平:每百萬 input tokens 5 美元、output tokens 25 美元,剛好係 Fable 5 嘅 10/50 美元一半。Fast mode 官方話大約快 2.5 倍,收費亦係基本價兩倍,即係去到同 Fable 5 相同嘅每百萬 tokens 10/50 美元。趕住等 agent 出結果時,Fast mode 有佢用途;批量 code review、夜間重構或者冇人坐喺度等嘅任務,標準速度通常划算好多。Claude Code 會用 usage credits 計 Fast mode,團隊最好先用自己 repository 嘅平均輸出量試算,唔好淨係睇每 token 單價。

Opus 5 發布頁未列出專屬 context window、最大輸出同數字 rate limits;發稿嗰刻,Claude Platform 嘅 model overview 亦仲未加入新型號。Opus 5 係咪沿用 Opus 4.8 嘅 100 萬 token context、128k 最大輸出,同埋 AWS、Google Cloud、Microsoft Foundry 各自幾時全面開通,暫時都係 [待確認]。Anthropic 只寫咗「all platforms」,企業遷移前仍要喺實際 cloud account 核對 model ID、region 同 quota,尤其係會跑幾個鐘嘅 agent,rate limit 往往先係最早撞到嗰道牆。

香港帳戶仍未列入官方支援地區

Anthropic 最新 supported countries 頁面分開列出 Claude API 同 Claude.ai 可用地區,兩份名單都冇香港。按官方資料,香港帳戶暫時唔屬正式支援範圍;已經經跨國公司 account、AWS、Google Cloud 或 Microsoft 平台使用 Claude 嘅團隊,就要跟返供應商帳戶所在地、region 同合約條款,唔應該假設個人香港帳戶可以直接開通。Opus 5 對香港開發團隊確實有吸引力,但供應方式未完全清楚之前,現有 production workflow 唔適合即刻全面切換。

整體睇,Opus 5 最吸引嘅組合係接近 Fable 嘅 coding 能力、少好多 safeguard 誤判,再用 Opus 原價交付。下一步要等獨立測試跑大型 repository、長時間 Claude Code session 同真實成本,睇下官方所講嘅穩定性可唔可以維持幾個鐘;已用緊 Opus 4.8 嘅團隊,可以先抽幾個最難重現、最常跨檔案嘅舊 bug 做 A/B 測試,再決定值唔值得改預設模型。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook