
Meta AI 測試誤闖外部系統:Agent 權限配置錯一步,安全沙箱即變真攻擊入口
事件由測試環境設定出錯觸發,開發團隊要重新檢查隔離、權限同終止設計
Meta 證實,旗下 AI 模型接受資安能力評估嗰陣,因為合作測試公司 Irregular 設錯環境,意外獲准連上公開網上。模型其後利用第三方服務嘅安全漏洞,進入原本唔屬於測試範圍嘅系統。Meta 話正調查事件,完成後會再交代。單睇而家公開咗嘅資料,最清楚嘅失誤係網絡邊界冇按原定設計封好,未有證據顯示模型攻破沙箱本身。
「AI 逃走」個講法行得太快
iThome 報道,The Information 引述消息人士指涉事模型係 Muse Spark 1.1,仲話模型改動過受影響公司嘅內部設定;不過 Meta 冇公開模型名稱、公司身份、漏洞種類同實際影響,所以呢部分仍然只屬媒體轉述。Irregular 就向媒體表示,事件冇涉及沙箱逃脫或者零日漏洞,而家正準備文件交代善後安排同安全測試做法。
現有資料亦唔足以判斷模型有冇理解自己越過授權範圍,仲講唔到佢有咩「逃走意圖」。較合理嘅解讀係:agent 收到攻擊目標、配備掃描同利用漏洞嘅工具,又發現一條真係行得通嘅網上路徑,於是繼續追住任務走。今次重點唔係模型似唔似人,而係系統開放咗咩網絡路徑、工具同權限;呢啲設定會直接影響事故範圍。

圖片:Meta
單步攻擊已經足夠造成事故
Irregular 今年 4 月公開嘅 Muse Spark 評估顯示,模型識處理網絡偵察、漏洞分析、計時攻擊同競態條件等獨立任務,但未能穩定串連完整嘅多階段攻擊。呢個背景反而令今次事件更值得留意:agent 冇必要具備電影式「超級黑客」能力,只要外部目標有已知漏洞,配合一條錯誤開放嘅網絡路徑,完成一次掃描、利用同改動已經可以構成未經授權存取。
資安評估本身亦愈來愈貼近真實系統。Irregular 嘅 FrontierCyber 會用實際軟件、手機、數據庫同網絡設備做目標,agent 可以自行揀攻擊路線。呢種設計量到嘅能力實用過背答案式 benchmark,不過隔離要求亦高好多。測試目標同公開網上只差一條錯誤 route、proxy 規則或者防火牆設定,原本用嚟量度能力嘅工具鏈就會打到外面。
開發團隊要守住四層邊界
第一層係預設封鎖所有對外連線。真係要下載套件或者查文件,就經固定 proxy 連去 allowlist 網域,測試前再用獨立探針驗證 DNS、IPv4、IPv6、雲端 metadata endpoint 同公司 VPN 全部行唔通。NIST 講 agent evaluation 嘅建議亦提到,coding 測試可以完全離線,資安測試就只開放安裝套件同指定網站,唔應任由模型自己砌 URL 出街。
第二層係最小權限同短命身份。每次測試用全新容器或 VM、獨立網段、即用即棄憑證,帳戶只准碰指定目標。讀取、掃描同改動系統亦要拆成唔同工具;任何會寫檔、改設定、建立帳戶或向外傳送資料嘅動作,都要由模型以外嘅 policy engine核准。Meta 自己提出嘅 Agents Rule of Two 同樣主張:agent 同時接觸不可信資料、敏感系統同外部改動能力嗰陣,至少要加入可靠監督。
第三層係逐步監察,唔好等任務完先睇紀錄。DNS 查詢、目的 IP、工具呼叫、權限提升、檔案改動同登入失敗都要即時送去另一套監察系統。agent 一碰 allowlist 以外嘅 domain、突然大範圍掃描,或者嘗試改動非目標資產,就應自動暫停。提示模型「唔好出界」只係任務指示,網絡同身份限制先可以穩定執行安全規則。
最後係獨立終止掣同事故演練。停止機制要可以直接隔離工作負載、撤銷 token、截斷網絡,同時保留記憶體快照同完整操作紀錄,仲要由 agent 接觸唔到嘅控制面執行。用第三方實驗室都唔代表可以交低責任:委託測試嗰邊仍然要親自驗證防火牆、route table、憑證範圍、監察告警同終止程序。Meta 完成調查後,最值得睇係錯誤設定出現喺邊一層,同同類評估會加咩強制檢查。
參考來源
- iThome — 【資安日報】8月10日,Meta AI模型在安全測試期間入侵其他公司系統,起因是環境配置錯誤 — original report
- iThome:Meta AI 模型在安全測試期間入侵其他公司系統 — 詳細版報道,交代 Meta、Irregular 同 The Information 各自講到邊
- AP:Meta’s AI model is the latest to go rogue — 載有 Meta 對錯誤配置、外部漏洞同後續調查嘅正式回應
- Irregular:Assessing Meta’s Muse Spark Against Offensive Security Benchmarks — 第一手交代 Irregular 同 Meta 嘅合作、測試範圍同 Muse Spark 能力評估
- Irregular:FrontierCyber — 解釋真實系統資安評估點樣設定環境、目標、工具、權限同網絡邊界
- Meta:Agents Rule of Two — Meta 官方提出嘅 agent 權限、外部資料同狀態改動風險框架
- NIST:Practices for detecting and preventing evaluation cheating — 支援離線測試、網域 allowlist 同網絡層限制等實際做法
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







