GPT-Red 自動追住 AI agent 漏洞打,0.05% 成功率其實講少咗好多嘢
Tech News

GPT-Red 自動追住 AI agent 漏洞打,0.05% 成功率其實講少咗好多嘢

圖片:via iThome — https://www.ithome.com.tw/news/177372
TechLab 編輯部(譯)·

攻擊樣本反過來訓練 GPT-5.6 Sol,但真實環境仍要逐層設防

Agent 識做得多,俾人騎劫時亦傷得深

普通聊天機械人中招,可能只係答錯問題;而家嘅 AI agent 可以睇 email、開網頁、翻查本機檔案、讀程式碼庫,甚至直接操作其他工具。惡意指令只要匿喺其中一個資料來源,就有機會令 agent 誤當成真正任務,偷偷上載敏感資料、改設定或者執行未經授權操作。模型接觸到幾多資料、揸住幾大權限,決定咗中招後可以搞出幾大件事。

GPT-Red 點樣追住漏洞打

OpenAI 嘅做法係訓練一個只供內部使用嘅攻擊模型 GPT-Red。研究團隊先建立唔同場景,界定攻擊者可以控制網頁橫額、email 內容、本機檔案或者工具輸出嘅邊一部分,再畀 GPT-Red 反覆出招、觀察結果同調整攻擊。防守模型變強,GPT-Red 就要再搵新寫法;成功樣本之後又會用嚟訓練下一批產品模型,形成一場持續升級嘅攻防練習。

OpenAI 話,喺一個冇放入 GPT-Red 訓練資料、仿照公開間接提示注入競賽嘅內部測試入面,GPT-Red 成功攻破 GPT-5.1 嘅場景佔 84%,人類紅隊就係 13%。呢個比較顯示,自動紅隊可以大規模追查漏洞,不過測試環境係 OpenAI 自行複製,完整方法、樣本同原始結果暫時未公開,外界亦未有獨立重現。

0.05% 唔等於實際攻擊近乎失效

最搶眼嘅數字係 GPT-5.6 Sol 面對 GPT-Red 直接提示注入時,平均每次攻擊成功率跌到 0.05%。呢類測試集中處理攻擊者直接向模型落惡意指令,結果亦只代表指定攻擊模型同留起嘅測試環境。網頁、email 或程式碼庫暗藏指令屬於間接注入,實際系統仲會受工具設計、權限、上下文同防護層影響,所以 0.05% 冇辦法推廣成所有提示注入嘅通用成功率。

公開研究亦提供咗另一組參考數字。Dziemian 等人舉辦嘅大型間接注入競賽收集咗 27.2 萬次攻擊,涵蓋工具操作、寫程式同電腦控制;受測嘅 13 款前沿模型全部有成功中招個案,整體攻擊成功率介乎 0.5% 至 8.5%。測試模型同方法都同 GPT-Red 唔同,數字唔應直接鬥高低,但足以說明外部內容、隱蔽攻擊同長任務仍然係另一組難題。

Codex 測試揭示開發環境嘅風險

GPT-Red 仲攻擊過一個以 GPT-5.4 mini 驅動嘅 Codex CLI agent。OpenAI 用 10 個未參與訓練嘅資料外洩場景,測試惡意內容可唔可以引導 agent 送走敏感資料;官方話 GPT-Red 成功覆蓋較多場景,用嘅 token 亦少過提示式 GPT-5.5 基準,但冇公開逐項成功率。對開發團隊嚟講,repo 內嘅文件、issue、依賴套件說明同工具回應都應當成不可信輸入,雲端憑證亦唔應長期暴露畀 agent。

模型防守進步,權限設計仍然要跟上

OpenAI 嘅方向合理:用攻擊模型大量搵人手未必撞到嘅漏洞,再將攻擊樣本餵返畀防守模型。不過公司自己亦話會繼續配合人類同第三方紅隊、分層防護同即時監察;GPT-Red 預印本喺公布消息時仍未發布。用緊 connected apps、瀏覽器 agent 或 Codex 嘅團隊,應限制每次任務可讀資料同可用工具,高風險操作要人手確認,憑證盡量短效,亦要保留操作紀錄。下一步值得睇嘅係預印本會公開幾多測試細節,同獨立研究可唔可以重現相關結果。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook