Claude 近排成日駁嘴:安全線收緊後,長文同 coding 都要改玩法
3C 產品

Claude 近排成日駁嘴:安全線收緊後,長文同 coding 都要改玩法

圖片:via Android Authority — https://www.androidauthority.com/claude-latest-models-pushback-bad-3683521/
TechLab 編輯部(譯)·

Sonnet 5 強咗,但 prompt 一含糊就易俾安全線截停

發生咩事

先講清楚:呢次係外媒作者嘅長期用法觀察,唔係實驗室測試。Android Authority 作者 Andrew Grush 話,佢以前鍾意 Claude,原因係長對話夠穩,會翻返前文,寫作深挖時似拍檔。近幾星期佢遇到相反情況:創作、宗教史、理財策劃、brainstorming 呢類題目,Claude 會誤會佢想做敏感或者有害嘢,跟住推返轉頭,甚至同一段 prompt 開新對話又答得返。呢種唔穩定,煩過單次拒答。

Anthropic 官方 Sonnet 5 發布圖,花枝排成 Claude 字母 C

圖片:Anthropic

官方文件講咗另一半

有趣位係,Anthropic 官方文件本身畀咗線索。Sonnet 5 喺 6 月 30 日推出,官方形容佢係最 agentic 嘅 Sonnet,強項係 coding、tool use 同 knowledge work;同時平台文件寫明,Sonnet 5 有實時 cybersecurity safeguards,碰到禁用或者高風險 cyber 題目,會用 refusal 回應,而且唔當 error。Fable 5 重推文講得仲白:安全分類器會刻意拉闊安全邊界,代價係有啲無害要求會俾擋。呢句其實就解釋咗點解用家會覺得模型「多管閒事」。

Anthropic 官方圖解安全分類器點樣喺安全邊界附近攔截要求

圖片:Anthropic

服務錯誤同拒答要分開睇

Claude status 頁 7 月確實有幾次 Sonnet 5、Fable 5、Opus 4.8 elevated errors,但嗰啲係服務錯誤,暫時未見 Anthropic 用正式 incident 名義列出「過度拒答」。所以而家最穩陣嘅講法係:社群同媒體有明顯投訴,官方文件亦承認分類器嚴咗會增加 false positives,但未有證據話 Claude 整體行為出咗一個已確認故障。呢個分別要講清楚:一邊係產品取捨,另一邊先係平台事故。

Agent 越強,安全線越易撞

問題唔只係 Claude 好似『脾氣差』:新一代模型要自己計劃、用工具、改 code、開 browser,平台自然會對含糊指令敏感好多。以前你叫 chatbot 幫你諗一段小說,佢最多出一段文;而家同一個模型可以讀 repo、改檔、跑指令,錯放一個危險 request 嘅後果大好多。安全線收緊有原因,但 false positive 一多,日常做嘢就卡住。

ChatGPT、Gemini、Claude 點揀

如果你要寫長文、整理複雜設定、追住一條討論線慢慢磨,Claude 仍然好有吸引力,尤其係佢肯配合嗰陣,語氣同結構通常好順。不過而家要預一手:敏感題材、假設情境、宗教、金融、bio/cyber 字眼,一含糊就可能俾安全線誤會。Gemini 嘅賣點係大 context,Google 官方話 Gemini in Pro 有 100 萬 token context,可一次睇好多頁文件同 code;適合餵大份資料、問交叉比對。ChatGPT / Codex 呢邊就偏向工具整合同 coding agent 協作,OpenAI 自己形容 Codex app 係可以同多個 agents 一齊跑長任務嘅控制台。

點減少模型估錯你

實際用法可以簡單啲:第一句先交代用途同邊界,例如「寫小說設定」、「做防守安全檢查」、「只要高層概念,唔要操作步驟」。第二,敏感問題拆細,先問背景、再問限制、最後先叫佢產出。第三,唔好同模型拗太耐;如果佢已經認定你有風險,開新 chat、換較穩定嘅模型,或者轉去 Gemini / ChatGPT,通常快過喺同一個對話入面解釋十次。第四,重要稿件同 code review 要保留人手判斷,因為安全拒答同過度自信都係同一類風險:模型估錯咗你真正要做咩。

付費值唔值,要睇你點用

所以今次唔應該急住下結論話 Claude 已經廢咗。Android Authority 作者自己都話,佢週末試 Fable 5、Opus 4.8 同 Sonnet 5,半打左右對話只遇到一次明顯 pushback;亦有好多用家日日用都冇撞牆。更實際係睇可靠度:如果你每次都靠 Claude 開長對話做寫作拍檔,一次誤判可能打斷成條思路;如果你主要用嚟 summary、改句、寫普通 email,影響可能細好多。

整體睇,Claude 仲係長文本同寫作推敲嘅強選項,但而家最好唔好當佢係唯一入口。長稿、研究、coding agent 任務,最好預備第二個模型做 fallback,同埋每次大任務一開始講清楚用途、風險邊界同輸出形式。下一步要睇 Anthropic 會唔會調低 false positive,尤其係 Sonnet 5 喺 Free / Pro 成為預設之後,呢啲誤判會唔會由少數投訴變成日常磨擦。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook