一個故事 prompt 繞過 AI 防線:26 款模型單輪越獄平均成功率 71.3%
Tech News

一個故事 prompt 繞過 AI 防線:26 款模型單輪越獄平均成功率 71.3%

圖片:via iThome — https://www.ithome.com.tw/news/177360
TechLab 編輯部(譯)·

F5 測試發現,模型分析內容嗰陣,亦可能繞過原有安全限制。

F5 Labs 最新測試玩咗一個幾取巧、但又幾貼近實際用途嘅方法:佢哋將危險操作藏入故事,再叫 AI 按文學框架分析情節。模型見到嘅任務似係閱讀理解,拆解內容時卻可能順手整理埋原本應該拒答嘅步驟。結果喺 26 款前沿模型之中,呢種單輪越獄嘅平均攻擊成功率去到 71.3%

故事包裝點解咁易過關

F5 將呢套攻擊叫做 Adversarial Tales。研究團隊寫咗 40 篇短篇故事,入面暗藏有害程序,再要求模型按指定敘事理論拆解角色、行動同情節功能。模型收到嘅表面上唔係直接嘅危險要求,而係佢擅長嘅內容分析任務,所以拒答機制未必及時介入。

呢個設計值得留意,因為企業本身就會叫 AI 摘要文件、抽取步驟、分析客服對話或者理解程式碼。攻擊借用嘅正正係模型正常能力,靠封鎖幾個敏感字眼好難處理晒。今次亦只用一輪輸入,冇靠多輪游說慢慢磨走限制;不過 F5 冇公開足夠資料畀外界完整重做測試,跨研究比較時要保留一手。

F5 Labs 展示近六個月 CASI 排名前十模型變化嘅圖表

圖片:F5 Labs

71.3% 有指定範圍,唔係通用失守率

數字要分清楚。F5 七月整體 CASI 評測涵蓋 55 款模型,用多類 prompt injection 同越獄攻擊量度防守表現;Adversarial Tales 呢個單輪項目就只測試 9 間供應商、合共 26 款前沿模型。所以 71.3% 只代表呢批模型面對呢 40 個故事樣本時嘅平均攻擊成功率,唔可以推論成任何 AI 對任何攻擊都有七成機會失守。

個別差距仍然幾大。F5 報告指 Qwen3 Max 嘅成功率最高,達 94%;Claude Haiku 4.5 最低,但亦有 35%。按供應商模型系列合計,Anthropic 為 47.5%,Qwen 同 Llama 系列就同為 91%。呢啲係 F5 按自家攻擊內容同判定方法得出嘅結果,可以用嚟初步評估風險,但唔應該單靠佢決定買邊款模型。

能力榜高分,安全表現可以差好遠

整體 CASI 榜亦見到能力同防守未必同步。F5 指 Claude Sonnet 5 以 93.08 分排榜首;開放權重嘅 NVIDIA Nemotron-3-Ultra-550B-A55B 有 83.68 分,但能力測試為 37.8%。另一邊,Zai GLM-5.2 能力測試有 51.1%,CASI 就得 46.58 分。即使幾款模型處理工作嘅能力接近,面對惡意輸入時都可以有好唔同反應。

CASI 本身由 F5 制定,而 F5 同時有售 AI red-team 同防護產品,報告自然帶有供應商角度。分數亦會受攻擊集、輸出判定器、模型版本同系統設定影響。公司可以用榜單縮窄候選名單,但正式部署前,仍然要用自己嘅資料類型、工具權限同高風險情境再測一次。

客服同 coding agent 出事,後果唔止答錯一句

純聊天模型越獄,最直接後果可能只係輸出不當內容。接駁 CRM、內部文件、電郵、程式碼倉庫或者操作工具之後,風險就會放大:外來文件可以夾帶指示,agent 亦可能整理敏感資料、錯誤呼叫工具,甚至代用戶執行操作。故事攻擊示範咗自然語言入面「內容」同「指令」嘅界線有幾模糊。

OWASP 嘅建議幾實際:模型只攞完成任務所需嘅最低權限,重要操作要有人確認,外來內容要清楚分隔,輸出亦要用獨立規則驗證。系統 prompt 可以幫手約束行為,但唔應承擔授權、資料存取同操作批准呢啲核心安全工作。揀安全分數較高嘅模型有幫助,權限設計同持續紅隊測試仍然要一齊做。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook