ChatGPT、Claude 遇到漏洞碼可能拒答:安全護欄點解會拖慢防守
Tech News

ChatGPT、Claude 遇到漏洞碼可能拒答:安全護欄點解會拖慢防守

圖片:via TechCrunch — https://techcrunch.com/2026/07/23/how-ai-guardrails-are-impeding-the-work-of-offensive-cybersecurity-researchers/
TechLab 編輯部(譯)·

海外 AI 平台用驗證、分類器同帳戶監察處理雙重用途請求

驗證漏洞,去到關鍵位就俾 AI 截停

TechCrunch 訪問咗幾名漏洞研究員同攻擊面專家,佢哋遇到嘅情況幾一致:叫模型讀程式、解釋組件或者幫手寫輔助工具通常冇問題,一去到驗證漏洞能否利用、砌概念驗證碼(PoC)或者分析惡意程式行為,ChatGPT、Claude 就可能停手。麻煩在於,成功觸發漏洞往往先證明問題真係存在同值得優先修補;淨係指出一段程式「可能有事」,企業未必肯即刻動資源處理。

NCC Group 首席科學家 Chris Anley 向 TechCrunch 解釋,修補漏洞同理解點樣利用漏洞,技術路徑好多時黐埋一齊。另一名受訪研究員 Chris Thompson 就話,即使身處限制較鬆嘅驗證計劃,模型表現仍可能唔一致,結果研究員花時間處理拒答,少咗時間分析漏洞。呢啲屬個別從業員經驗,唔代表所有模型、帳戶同產品介面都會有相同結果,但足以反映自動分類喺實際資安工作有幾難校準。

兩隻手托住鎖孔圖案,代表 AI 網絡安全護欄同存取限制

圖片:Anthropic

一段 PoC,分類器睇唔到授權書

安全護欄最難處理嘅位係「雙重用途」。同一段輸入可以來自受委託嘅滲透測試、內部紅隊、bug bounty,亦可以來自準備入侵真實系統嘅人。模型見到嘅主要係程式碼、目標描述同要求,未必掌握測試合約、漏洞披露安排、隔離環境或者研究員過往紀錄。只靠一次對話判斷意圖,誤判幾乎避唔晒。

Anthropic 公開講明,Claude 嘅即時護欄會預設攔截漏洞利用同攻擊工具開發等「高風險雙重用途」內容,合資格防守人員可申請免費 Cyber Verification Program(CVP)。Fable 5 用嘅安全分類器再劃出禁止、高風險、低風險同一般用途幾類;官方亦承認,刻意留闊安全邊界會增加正常請求俾人誤截嘅機會。換句話講,呢個取捨係平台有意接受,唔單純係模型答錯問題。

拒答背後其實有幾層控制

見到一句拒絕訊息,未必係模型本身突然變保守。 第一層可以係模型訓練時學識拒答;第二層係平台另外加嘅即時分類器,輸入或輸出踩線就截停;第三層係帳戶身份、機構驗證、使用紀錄同離線監察;第四層則視乎你用緊 ChatGPT、Claude.ai、API、Claude Code,抑或第三方雲端平台。相同模型名經唔同入口,權限同處理結果都可能有落差。

OpenAI 而家用 Trusted Access for Cyber 處理呢類需求,普通 GPT-5.5、獲驗證嘅 GPT-5.5,同專門處理高風險授權任務嘅 GPT-5.5-Cyber,適用範圍各有分別。官方列明紅隊測試、滲透測試、漏洞利用驗證、逆向工程同惡意程式分析可以納入授權用途,不過獲批唔會移除全部護欄,亦唔保證取得每個網絡安全專用模型。將所有拒答一概講成「平台禁止資安研究」,其實會漏咗權限配置同產品入口呢兩層問題。

保密要求同寬鬆權限撞到正

驗證計劃仲有一個幾現實嘅矛盾:研究涉及未公開漏洞時,團隊通常唔想將資料上傳雲端,但呢類工作偏偏較容易觸發護欄,要申請更寬鬆嘅權限。 OpenAI 列明 Trusted Access 唔會自動附送 Zero Data Retention;Anthropic 更要求 CVP 啟用資料保留,原本用緊 Zero Data Retention 嘅 API 機構要另設 workspace。對處理零日漏洞、客戶原始碼或者未公開事故資料嘅團隊,呢個條件可能難接受過模型拒答。

所以原文有研究員轉用可本機跑嘅開放權重模型,考慮同時包括可用性同保密。呢條路可以避免把程式碼送出公司,但團隊要自己負責權限隔離、模型來源、日誌、沙箱同輸出審核;能力亦未必追得上最強嘅封閉模型。傳統反組譯器、debugger、fuzzer、靜態分析器同惡意程式沙箱仍然重要,AI 較適合幫手整理線索、解釋程式同加快重複工序,關鍵判斷繼續由研究員揸主意。

資安團隊可以點部署

處理授權紅隊或漏洞研究嘅公司,較穩陣嘅做法係申請正式驗證,為內部資安另開獨立機構或 workspace,清楚保存測試授權、資料分類同可用工具範圍。遇到明顯誤截時,記低模型、產品入口、時間、request ID 同經刪減嘅任務描述,再經官方支援渠道追查。靠反覆改寫 prompt 磨過護欄既唔穩定,亦可能觸發帳戶風控,唔適合放入企業應變程序。

對滲透測試公司、bug bounty 研究員同企業 IT 隊伍,AI 而家確實可以加快逆向工程同漏洞初步分類。不過最強能力逐步綁定身份驗證、指定帳戶同資料保留安排,採購時就要連保密條款、授權範圍同後備工具一齊評估。下一步值得睇嘅係兩間公司能否降低合法請求嘅誤截率,同時畀專業團隊一條保密要求更清楚、審批速度更穩定嘅使用途徑。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook