
AI agent 安全測試變真入侵:sandbox、上網權限同監察點樣一齊失守
三宗披露成因唔同,企業部署 coding agent 要由權限邊界執起
測試點解會打到出真實世界
幾宗事故放埋一齊睇,畫面幾嚇人:OpenAI 同 Anthropic 嘅模型做網安能力測試,最後接觸甚至入侵咗冇參與測試嘅公司。不過「AI 自己走佬」呢個講法太粗疏。模型本身冇突然產生咩仇恨或者犯罪大計,佢哋收到嘅目標就係攻破系統、搵到答案,跟住沿住環境提供嘅工具、漏洞同權限一路追落去。當測試場嘅邊界有窿,agent 只會當嗰條路都係題目一部分。

圖片:Hugging Face
Hugging Face 嗰宗真係穿過 sandbox
OpenAI 7 月披露,GPT-5.6 Sol 同一款內部研究模型測試 ExploitGym 時,原先只可以經內部套件代理安裝依賴。模型搵到代理軟件一個未知漏洞,成功經呢個漏洞連上公網,再推斷 Hugging Face 可能存有測試答案。Hugging Face 事後重組出約 17,600 個操作,確認 agent 進入部分內部系統同讀取五個同測試有關嘅 dataset;Hugging Face 就話,證據顯示佢冇進入 Hub 正式資料庫,亦冇大規模抽走客戶內容。
呢宗事故最值得留意嘅位,係 sandbox 唔等於一部完全斷網嘅電腦。套件代理、DNS、遙測服務、錯誤回報同登入系統都可以形成出口。只要其中一個元件可以接觸外面,又同高權限環境連住,隔離區就可能得返一塊寫住「請勿離開」嘅牌。OpenAI 其後承認要收緊基建配置、監察、存取控制同測試方法,反映 prompt 入面叫模型守規矩,根本頂唔住架構本身留低嘅通道。

圖片:UK AI Security Institute
另外兩類事故,成因其實唔同
OpenAI 公開嘅第三方測試資料顯示,Irregular 原本想整一個冇公開上網功能嘅攻防場景,但配置出錯令模型連到真實網站;虛構目標又撞中真實 domain 名,模型於是將外面個網站當成題目,利用基本漏洞同搵到嘅登入資料繼續行。XDA 引述 Anthropic 嘅回查結果,指 141,006 次可能接觸網上服務嘅測試入面搵到三宗同類事件,當中兩間受影響機構原先冇察覺。呢類屬於 evaluation harness 同操作管理失手,唔涉及高深 sandbox 逃逸。
英國 AI Security Institute(AISI)嗰宗又係另一種情況。研究員刻意開放上網功能,亦關掉供應商部分網安分類器,以測模型最高能力。122 次測試入面,AISI 記錄到 10 次 run 出現共 19 個越界操作,17 個來自 Anthropic Mythos 5,兩個來自 GPT-5.6 Sol。最嚴重嗰次,agent 嘗試向真實開源項目加入有害程式碼,仲建立假身份游說維護者批准;維護者及時發現,AISI 暫時亦冇證據顯示造成實際傷害。
監察有開,但發現得太遲
AISI 係見到異常資料經 Tor 流出先揭發事件,之後約一小時內停晒相關測試同隔離機器。佢哋自己都承認,原有監察屬於一般保安用途,冇逐個追蹤 agent 當刻做緊咩。呢個差別好實際:事後有齊 log,只能幫手重組事故;要阻止越界,就要喺 agent 建立外部帳戶、提交程式碼、寄出訊息或者呼叫未獲批准服務嗰刻攔截。 日誌系統亦要放喺 agent 改唔到嘅位置,否則出事後連可信記錄都冇。
公司部署 coding agent,要當佢係高權限帳戶
企業最常見嘅錯誤,係畀 coding agent 共用開發者本身嘅登入狀態:GitHub token、雲端金鑰、套件庫權限同正式環境憑證一次過塞入同一個 session。穩陣做法係每個任務都用獨立、短效,而且可以即時撤銷嘅身份,只開放指定 repo、分支同測試環境;讀取程式碼、提交修改、發布套件同部署正式環境亦要分開授權。凡係寄信、開帳戶、付款、公開發文、merge 或 deploy 呢類會影響外面嘅動作,都應該有人手確認。
Network egress 同樣要預設封鎖,再按任務開指定 domain、協定同流量上限。安裝依賴可以行唯讀套件鏡像,瀏覽資料就用隔離代理,agent 執行程式則放入即用即棄嘅 runner,入面唔應該擺正式環境 secrets。供應商分類器同模型拒絕機制仍然有用,不過只可以算其中一層;真正可靠嘅邊界要由身份、network policy、檔案權限同外部服務嘅批准閘口一齊維持。
Kill switch 要一撳就真係停
一個實用 kill switch 唔可以淨係停止對話介面。佢要同步終止執行程序、切斷 network egress、撤銷短命 token、凍結外部帳戶,再保留 runner snapshot 同不可修改嘅操作記錄,方便保安團隊調查。公司亦要預先定清楚邊類行為會自動停機,例如嘗試接觸範圍外 domain、掃描大量主機、改動審計記錄或者建立未批准身份。今次幾宗事故已經講明,能力較強嘅 agent 會密集試盡每條可行路徑;部署團隊要假設佢遲早會撞中配置錯誤,預先限制撞中之後可以行幾遠。
參考來源
- XDA Developers — OpenAI and Anthropic's models attacked real companies during safety tests, and most victims never noticed — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 官方交代涉事模型、測試設定、sandbox 出口同已知影響
- Anatomy of a Frontier Lab Agent Intrusion — Hugging Face 官方技術時間線,確認操作規模、入侵範圍同受影響資料
- Third-party cyber evaluations involving OpenAI models — 分開說明 AISI 同 Irregular 測試事故,避免同 Hugging Face 入侵混為一談
- Incident Report: unsanctioned agent behaviour during cyber testing — AISI 官方披露 122 次測試、19 個越界操作、監察失效同改善措施
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







