
Claude 近排成日駁嘴:安全線收緊後,長文同 coding 都要改玩法
Sonnet 5 強咗,但 prompt 一含糊就易俾安全線截停
發生咩事
先講清楚:呢次係外媒作者嘅長期用法觀察,唔係實驗室測試。Android Authority 作者 Andrew Grush 話,佢以前鍾意 Claude,原因係長對話夠穩,會翻返前文,寫作深挖時似拍檔。近幾星期佢遇到相反情況:創作、宗教史、理財策劃、brainstorming 呢類題目,Claude 會誤會佢想做敏感或者有害嘢,跟住推返轉頭,甚至同一段 prompt 開新對話又答得返。呢種唔穩定,煩過單次拒答。

圖片:Anthropic
官方文件講咗另一半
有趣位係,Anthropic 官方文件本身畀咗線索。Sonnet 5 喺 6 月 30 日推出,官方形容佢係最 agentic 嘅 Sonnet,強項係 coding、tool use 同 knowledge work;同時平台文件寫明,Sonnet 5 有實時 cybersecurity safeguards,碰到禁用或者高風險 cyber 題目,會用 refusal 回應,而且唔當 error。Fable 5 重推文講得仲白:安全分類器會刻意拉闊安全邊界,代價係有啲無害要求會俾擋。呢句其實就解釋咗點解用家會覺得模型「多管閒事」。

圖片:Anthropic
服務錯誤同拒答要分開睇
Claude status 頁 7 月確實有幾次 Sonnet 5、Fable 5、Opus 4.8 elevated errors,但嗰啲係服務錯誤,暫時未見 Anthropic 用正式 incident 名義列出「過度拒答」。所以而家最穩陣嘅講法係:社群同媒體有明顯投訴,官方文件亦承認分類器嚴咗會增加 false positives,但未有證據話 Claude 整體行為出咗一個已確認故障。呢個分別要講清楚:一邊係產品取捨,另一邊先係平台事故。
Agent 越強,安全線越易撞
問題唔只係 Claude 好似『脾氣差』:新一代模型要自己計劃、用工具、改 code、開 browser,平台自然會對含糊指令敏感好多。以前你叫 chatbot 幫你諗一段小說,佢最多出一段文;而家同一個模型可以讀 repo、改檔、跑指令,錯放一個危險 request 嘅後果大好多。安全線收緊有原因,但 false positive 一多,日常做嘢就卡住。
ChatGPT、Gemini、Claude 點揀
如果你要寫長文、整理複雜設定、追住一條討論線慢慢磨,Claude 仍然好有吸引力,尤其係佢肯配合嗰陣,語氣同結構通常好順。不過而家要預一手:敏感題材、假設情境、宗教、金融、bio/cyber 字眼,一含糊就可能俾安全線誤會。Gemini 嘅賣點係大 context,Google 官方話 Gemini in Pro 有 100 萬 token context,可一次睇好多頁文件同 code;適合餵大份資料、問交叉比對。ChatGPT / Codex 呢邊就偏向工具整合同 coding agent 協作,OpenAI 自己形容 Codex app 係可以同多個 agents 一齊跑長任務嘅控制台。
點減少模型估錯你
實際用法可以簡單啲:第一句先交代用途同邊界,例如「寫小說設定」、「做防守安全檢查」、「只要高層概念,唔要操作步驟」。第二,敏感問題拆細,先問背景、再問限制、最後先叫佢產出。第三,唔好同模型拗太耐;如果佢已經認定你有風險,開新 chat、換較穩定嘅模型,或者轉去 Gemini / ChatGPT,通常快過喺同一個對話入面解釋十次。第四,重要稿件同 code review 要保留人手判斷,因為安全拒答同過度自信都係同一類風險:模型估錯咗你真正要做咩。
付費值唔值,要睇你點用
所以今次唔應該急住下結論話 Claude 已經廢咗。Android Authority 作者自己都話,佢週末試 Fable 5、Opus 4.8 同 Sonnet 5,半打左右對話只遇到一次明顯 pushback;亦有好多用家日日用都冇撞牆。更實際係睇可靠度:如果你每次都靠 Claude 開長對話做寫作拍檔,一次誤判可能打斷成條思路;如果你主要用嚟 summary、改句、寫普通 email,影響可能細好多。
整體睇,Claude 仲係長文本同寫作推敲嘅強選項,但而家最好唔好當佢係唯一入口。長稿、研究、coding agent 任務,最好預備第二個模型做 fallback,同埋每次大任務一開始講清楚用途、風險邊界同輸出形式。下一步要睇 Anthropic 會唔會調低 false positive,尤其係 Sonnet 5 喺 Free / Pro 成為預設之後,呢啲誤判會唔會由少數投訴變成日常磨擦。
參考來源
- Android Authority — I used to love Claude, but the latest models are slowly ruining it — original report
- Introducing Claude Sonnet 5 — Anthropic 官方 Sonnet 5 發布文,確認模型定位、定價、安全評估同 cyber safeguards。
- What's new in Claude Sonnet 5 — 官方 API 文件,列出 adaptive thinking、sampling 參數限制、1M context、新 tokenizer,同 refusal 回傳方式。
- Redeploying Fable 5 — Anthropic 官方解釋 Fable 5 / Mythos 5 暫停同重開,明講安全分類器會增加 benign request false positives。
- Claude Status — 核對 7 月多次 elevated errors,未見官方用 status incident 方式列出 pushback。
- Claude refusing to generate text as it was not AI? — 社群案例,集中講 Opus 4.8 / 新 Sonnet 出現 moral grandstanding 同 refusals。
- Gemini in Pro and long context — Google 官方頁,確認 Gemini in Pro 可處理 100 萬 token context,大檔案同 code 分析係賣點。
- Introducing the Codex app — OpenAI 官方介紹 Codex app,說明多 agents、長任務、diff review 同開發協作定位。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







