
AI 愈強拒答愈多?Claude Fable 5 嘅安全取捨
生物題被轉去 Opus 4.8,問題唔只係答案少咗。
連線粒體都答唔到,先奇怪
Anthropic 啱啱推 Claude Fable 5,官方話佢係第一個可以普遍用到嘅 Mythos-class 模型,能力壓過以往公開 Claude,主打長時間 coding、知識工作、vision 同科學研究。The Verge 試咗一堆普通生物題,例如「線粒體係咩」、「細胞膜係咩」、「mRNA 疫苗點運作」,Fable 5 竟然唔自己答,通常轉去 Claude Opus 4.8。呢個唔似模型唔識,而係產品層面刻意落閘。

圖片:Anthropic
Anthropic 做緊一個好硬嘅取捨
官方講法係,Fable 5 同 Mythos 5 其實同一底層模型;Fable 5 面向一般用戶,所以加咗 cyber、生物/化學同模型 distillation 分類器。命中分類器,Claude app 會顯示 fallback,改由 Opus 4.8 回覆;API 預設更硬,可能直接 block,開發者要自己設計 fallback 或改設定。Anthropic 話平均少於 5% session 會觸發,但生物題明顯係高敏區,正常學習問題都會被掃中。

圖片:Anthropic
點解生物特別敏感
System card 個重點唔係「生物知識危險」咁簡單。Anthropic 評估 Mythos 5 已有 CB-1 級化學/生物能力,即係可能幫到高資源威脅者慳時間,但未去到 CB-2,未可取代頂尖專家做新型武器研發。呢個判斷比以前模型冇咁清楚,所以公司揀先放一個被鎖住嘅 Fable 5 出嚟,再用 trusted access 畀少量 cyber 防守同生命科學研究伙伴試 Mythos。
用戶會撞到咩
最麻煩位係體驗唔穩定。同一個工具,問 coding 或文件分析可能覺得佢好醒;轉去生物、醫療資料整理、security audit,就可能忽然降級或者拒答。學生用嚟溫書會以為自己問錯;developer 用 API 會見到成本、latency、回覆質素同 log 都變複雜;公司 IT 做採購,更加唔可以只睇 benchmark,要用自己真實 prompt set 測試 fallback 率。仲有一點容易漏:官方寫明 Fable 需要 30 日 data retention 做安全監察,企業資料流程要先計清楚。
我點睇
我唔覺得 Anthropic 應該放開晒。模型真係強到可以加速真實世界科研同攻擊準備,安全閘唔係裝飾。但而家 Fable 5 呢種做法太粗,連基本生物常識都被掃走,會令好多人誤判模型能力,甚至覺得 AI 公司用「安全」遮住產品限制。最好嘅做法應該係更細粒度:教育性高層次答案可以答,實驗操作、危險合成、攻擊步驟先 block。
揀 AI 工具要睇埋政策
之後揀模型,唔好再問「邊個最叻」就算。要問三件事:邊啲題會 fallback、fallback 後由邊個模型答、API 有冇清楚事件同收費紀錄。Fable 5 呢單新聞其實提醒咗一件事:未來最強模型未必等於最好用模型;真正影響工作流嘅,係模型能力、安全政策同產品設計三樣綁埋一齊之後,畀你用到幾多。
參考來源
- The Verge — Claude Fable won’t answer basic biology questions — original report
- Anthropic: Claude Fable 5 and Claude Mythos 5 — 官方發布文,確認 Fable 5、Mythos 5 定位、能力、安全限制同 fallback 大方向。
- Anthropic: Claude Fable — 產品頁確認 Fable 5 面向一般用戶、敏感領域會轉去 Opus 4.8,同資料保留要求。
- Anthropic: Claude Mythos — 官方 Mythos 頁,補充 restricted access 同高風險能力解釋。
- Anthropic: Claude Fable 5 & Claude Mythos 5 System Card — 主要技術文件,交代 CB-1/CB-2 評估、novel safeguards、API fallback 行為同風險判斷。
- Anthropic Responsible Scaling Policy — 背景文件,用嚟理解 Anthropic 點樣按能力風險分級同部署 frontier 模型。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







