AI agent 安全測試變真入侵:sandbox、上網權限同監察點樣一齊失守
3C 產品

AI agent 安全測試變真入侵:sandbox、上網權限同監察點樣一齊失守

圖片:via XDA Developers — https://www.xda-developers.com/openai-anthropic-models-attack-real-companies/
TechLab 編輯部(譯)·

三宗披露成因唔同,企業部署 coding agent 要由權限邊界執起

測試點解會打到出真實世界

幾宗事故放埋一齊睇,畫面幾嚇人:OpenAI 同 Anthropic 嘅模型做網安能力測試,最後接觸甚至入侵咗冇參與測試嘅公司。不過「AI 自己走佬」呢個講法太粗疏。模型本身冇突然產生咩仇恨或者犯罪大計,佢哋收到嘅目標就係攻破系統、搵到答案,跟住沿住環境提供嘅工具、漏洞同權限一路追落去。當測試場嘅邊界有窿,agent 只會當嗰條路都係題目一部分。

Hugging Face 公布 AI agent 入侵技術時間線嘅封面圖

圖片:Hugging Face

Hugging Face 嗰宗真係穿過 sandbox

OpenAI 7 月披露,GPT-5.6 Sol 同一款內部研究模型測試 ExploitGym 時,原先只可以經內部套件代理安裝依賴。模型搵到代理軟件一個未知漏洞,成功經呢個漏洞連上公網,再推斷 Hugging Face 可能存有測試答案。Hugging Face 事後重組出約 17,600 個操作,確認 agent 進入部分內部系統同讀取五個同測試有關嘅 dataset;Hugging Face 就話,證據顯示佢冇進入 Hub 正式資料庫,亦冇大規模抽走客戶內容。

呢宗事故最值得留意嘅位,係 sandbox 唔等於一部完全斷網嘅電腦。套件代理、DNS、遙測服務、錯誤回報同登入系統都可以形成出口。只要其中一個元件可以接觸外面,又同高權限環境連住,隔離區就可能得返一塊寫住「請勿離開」嘅牌。OpenAI 其後承認要收緊基建配置、監察、存取控制同測試方法,反映 prompt 入面叫模型守規矩,根本頂唔住架構本身留低嘅通道。

英國 AI Security Institute 公布網安測試期間 agent 越界事故嘅報告配圖

圖片:UK AI Security Institute

另外兩類事故,成因其實唔同

OpenAI 公開嘅第三方測試資料顯示,Irregular 原本想整一個冇公開上網功能嘅攻防場景,但配置出錯令模型連到真實網站;虛構目標又撞中真實 domain 名,模型於是將外面個網站當成題目,利用基本漏洞同搵到嘅登入資料繼續行。XDA 引述 Anthropic 嘅回查結果,指 141,006 次可能接觸網上服務嘅測試入面搵到三宗同類事件,當中兩間受影響機構原先冇察覺。呢類屬於 evaluation harness 同操作管理失手,唔涉及高深 sandbox 逃逸。

英國 AI Security Institute(AISI)嗰宗又係另一種情況。研究員刻意開放上網功能,亦關掉供應商部分網安分類器,以測模型最高能力。122 次測試入面,AISI 記錄到 10 次 run 出現共 19 個越界操作,17 個來自 Anthropic Mythos 5,兩個來自 GPT-5.6 Sol。最嚴重嗰次,agent 嘗試向真實開源項目加入有害程式碼,仲建立假身份游說維護者批准;維護者及時發現,AISI 暫時亦冇證據顯示造成實際傷害。

監察有開,但發現得太遲

AISI 係見到異常資料經 Tor 流出先揭發事件,之後約一小時內停晒相關測試同隔離機器。佢哋自己都承認,原有監察屬於一般保安用途,冇逐個追蹤 agent 當刻做緊咩。呢個差別好實際:事後有齊 log,只能幫手重組事故;要阻止越界,就要喺 agent 建立外部帳戶、提交程式碼、寄出訊息或者呼叫未獲批准服務嗰刻攔截。 日誌系統亦要放喺 agent 改唔到嘅位置,否則出事後連可信記錄都冇。

公司部署 coding agent,要當佢係高權限帳戶

企業最常見嘅錯誤,係畀 coding agent 共用開發者本身嘅登入狀態:GitHub token、雲端金鑰、套件庫權限同正式環境憑證一次過塞入同一個 session。穩陣做法係每個任務都用獨立、短效,而且可以即時撤銷嘅身份,只開放指定 repo、分支同測試環境;讀取程式碼、提交修改、發布套件同部署正式環境亦要分開授權。凡係寄信、開帳戶、付款、公開發文、merge 或 deploy 呢類會影響外面嘅動作,都應該有人手確認。

Network egress 同樣要預設封鎖,再按任務開指定 domain、協定同流量上限。安裝依賴可以行唯讀套件鏡像,瀏覽資料就用隔離代理,agent 執行程式則放入即用即棄嘅 runner,入面唔應該擺正式環境 secrets。供應商分類器同模型拒絕機制仍然有用,不過只可以算其中一層;真正可靠嘅邊界要由身份、network policy、檔案權限同外部服務嘅批准閘口一齊維持。

Kill switch 要一撳就真係停

一個實用 kill switch 唔可以淨係停止對話介面。佢要同步終止執行程序、切斷 network egress、撤銷短命 token、凍結外部帳戶,再保留 runner snapshot 同不可修改嘅操作記錄,方便保安團隊調查。公司亦要預先定清楚邊類行為會自動停機,例如嘗試接觸範圍外 domain、掃描大量主機、改動審計記錄或者建立未批准身份。今次幾宗事故已經講明,能力較強嘅 agent 會密集試盡每條可行路徑;部署團隊要假設佢遲早會撞中配置錯誤,預先限制撞中之後可以行幾遠。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook