
ChatGPT、Claude 遇到漏洞碼可能拒答:安全護欄點解會拖慢防守
海外 AI 平台用驗證、分類器同帳戶監察處理雙重用途請求
驗證漏洞,去到關鍵位就俾 AI 截停
TechCrunch 訪問咗幾名漏洞研究員同攻擊面專家,佢哋遇到嘅情況幾一致:叫模型讀程式、解釋組件或者幫手寫輔助工具通常冇問題,一去到驗證漏洞能否利用、砌概念驗證碼(PoC)或者分析惡意程式行為,ChatGPT、Claude 就可能停手。麻煩在於,成功觸發漏洞往往先證明問題真係存在同值得優先修補;淨係指出一段程式「可能有事」,企業未必肯即刻動資源處理。
NCC Group 首席科學家 Chris Anley 向 TechCrunch 解釋,修補漏洞同理解點樣利用漏洞,技術路徑好多時黐埋一齊。另一名受訪研究員 Chris Thompson 就話,即使身處限制較鬆嘅驗證計劃,模型表現仍可能唔一致,結果研究員花時間處理拒答,少咗時間分析漏洞。呢啲屬個別從業員經驗,唔代表所有模型、帳戶同產品介面都會有相同結果,但足以反映自動分類喺實際資安工作有幾難校準。

圖片:Anthropic
一段 PoC,分類器睇唔到授權書
安全護欄最難處理嘅位係「雙重用途」。同一段輸入可以來自受委託嘅滲透測試、內部紅隊、bug bounty,亦可以來自準備入侵真實系統嘅人。模型見到嘅主要係程式碼、目標描述同要求,未必掌握測試合約、漏洞披露安排、隔離環境或者研究員過往紀錄。只靠一次對話判斷意圖,誤判幾乎避唔晒。
Anthropic 公開講明,Claude 嘅即時護欄會預設攔截漏洞利用同攻擊工具開發等「高風險雙重用途」內容,合資格防守人員可申請免費 Cyber Verification Program(CVP)。Fable 5 用嘅安全分類器再劃出禁止、高風險、低風險同一般用途幾類;官方亦承認,刻意留闊安全邊界會增加正常請求俾人誤截嘅機會。換句話講,呢個取捨係平台有意接受,唔單純係模型答錯問題。
拒答背後其實有幾層控制
見到一句拒絕訊息,未必係模型本身突然變保守。 第一層可以係模型訓練時學識拒答;第二層係平台另外加嘅即時分類器,輸入或輸出踩線就截停;第三層係帳戶身份、機構驗證、使用紀錄同離線監察;第四層則視乎你用緊 ChatGPT、Claude.ai、API、Claude Code,抑或第三方雲端平台。相同模型名經唔同入口,權限同處理結果都可能有落差。
OpenAI 而家用 Trusted Access for Cyber 處理呢類需求,普通 GPT-5.5、獲驗證嘅 GPT-5.5,同專門處理高風險授權任務嘅 GPT-5.5-Cyber,適用範圍各有分別。官方列明紅隊測試、滲透測試、漏洞利用驗證、逆向工程同惡意程式分析可以納入授權用途,不過獲批唔會移除全部護欄,亦唔保證取得每個網絡安全專用模型。將所有拒答一概講成「平台禁止資安研究」,其實會漏咗權限配置同產品入口呢兩層問題。
保密要求同寬鬆權限撞到正
驗證計劃仲有一個幾現實嘅矛盾:研究涉及未公開漏洞時,團隊通常唔想將資料上傳雲端,但呢類工作偏偏較容易觸發護欄,要申請更寬鬆嘅權限。 OpenAI 列明 Trusted Access 唔會自動附送 Zero Data Retention;Anthropic 更要求 CVP 啟用資料保留,原本用緊 Zero Data Retention 嘅 API 機構要另設 workspace。對處理零日漏洞、客戶原始碼或者未公開事故資料嘅團隊,呢個條件可能難接受過模型拒答。
所以原文有研究員轉用可本機跑嘅開放權重模型,考慮同時包括可用性同保密。呢條路可以避免把程式碼送出公司,但團隊要自己負責權限隔離、模型來源、日誌、沙箱同輸出審核;能力亦未必追得上最強嘅封閉模型。傳統反組譯器、debugger、fuzzer、靜態分析器同惡意程式沙箱仍然重要,AI 較適合幫手整理線索、解釋程式同加快重複工序,關鍵判斷繼續由研究員揸主意。
資安團隊可以點部署
處理授權紅隊或漏洞研究嘅公司,較穩陣嘅做法係申請正式驗證,為內部資安另開獨立機構或 workspace,清楚保存測試授權、資料分類同可用工具範圍。遇到明顯誤截時,記低模型、產品入口、時間、request ID 同經刪減嘅任務描述,再經官方支援渠道追查。靠反覆改寫 prompt 磨過護欄既唔穩定,亦可能觸發帳戶風控,唔適合放入企業應變程序。
對滲透測試公司、bug bounty 研究員同企業 IT 隊伍,AI 而家確實可以加快逆向工程同漏洞初步分類。不過最強能力逐步綁定身份驗證、指定帳戶同資料保留安排,採購時就要連保密條款、授權範圍同後備工具一齊評估。下一步值得睇嘅係兩間公司能否降低合法請求嘅誤截率,同時畀專業團隊一條保密要求更清楚、審批速度更穩定嘅使用途徑。
參考來源
- TechCrunch — How AI guardrails are impeding the work of offensive cybersecurity researchers — original report
- OpenAI Daybreak — Trusted Access for Cyber Overview — 核對 OpenAI 驗證層級、適用用途、資料保留同權限限制
- OpenAI Usage Policies — 核對 OpenAI 對惡意網絡活動、未經授權測試同繞過安全措施嘅現行規則
- Real-time cyber safeguards on Claude Opus and Sonnet — 核對 Anthropic 即時分類器、CVP 申請範圍同資料保留要求
- More details on Fable 5’s cyber safeguards and our jailbreak framework — Anthropic 解釋雙重用途分類、安全邊界同誤截取捨嘅官方文章
- Anthropic Usage Policy Update — 核對 Anthropic 對獲授權漏洞研究同惡意網絡活動嘅政策背景
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







