Meta AI 安全測試誤闖真實公司:三宗事故揭出 sandbox 邊界有幾脆弱
Tech News

Meta AI 安全測試誤闖真實公司:三宗事故揭出 sandbox 邊界有幾脆弱

圖片:via iThome — https://www.ithome.com.tw/news/177957
TechLab 編輯部(譯)·

Meta 確認第三方測試環境錯誤開放網絡,完整調查仍然未出

Meta 到底確認咗幾多

Meta 證實,第三方安全測試公司 Irregular 配置環境時出錯,令一個原本受控嘅 AI 模型意外連到網上。模型之後利用某項第三方服務漏洞,進入其他公司系統。iThome 報道引述 The Information 消息指,涉事模型可能係 Muse Spark 1.1,仲改動過對方內部設定;不過 Meta 未有公開確認模型名稱、受影響公司、漏洞種類同改動內容,所以呢幾項細節暫時只可以視作消息人士講法。

Irregular 向傳媒表示,今次冇證據顯示模型突破 sandbox,亦冇用到 zero-day 漏洞。Meta 同 Irregular 仲調查緊,Irregular 話會整理事故處理同安全連網測試嘅白皮書。現階段可以講實嘅範圍其實幾窄:測試環境開錯網絡權限,模型接觸到真實服務,再利用嗰邊已有嘅安全弱點。至於造成咗幾大影響,公開資料暫時未夠判斷。

Sandbox 個名唔代表真係隔離到

AI agent 嘅 sandbox 從來都唔只係一部虛擬機。模型背後仲有執行工具、網絡出口、DNS、代理服務、登入憑證、檔案權限同雲端身份;任何一層留咗窿,agent 都可能沿住條路繼續做任務。Prompt 話「你而家喺模擬環境」只係一句指示,擋唔到真正嘅網絡連線。 如果系統同時畀模型掃描、登入、寫檔或者改設定,錯配一次已經足以令模擬攻擊踩入真實環境。

呢點亦解釋到點解事件容易俾人講成「AI 逃走」,但公開資料未支持呢種講法。模型本身冇突然多出一條神秘通道;今次係測試系統本身提供咗可用路徑。麻煩在於 agent 會持續追住任務目標,亦可以好快試唔同方法。一個普通配置錯誤放喺自動化程度高、工具權限大嘅 agent 前面,後果自然可以放大得好快。

OpenAI、Anthropic、Meta 三宗事故差喺邊

OpenAI 嗰宗技術上嚴重一截。官方調查指,模型喺高度隔離嘅測試環境內,搵到套件 registry 快取代理嘅 zero-day 漏洞,取得公開網絡連線,再接觸 Hugging Face 生產系統。Anthropic 之後翻查 141,006 次相關測試,發現三宗 Claude 經第三方測試環境連到網上、進入三間機構系統嘅事故;嗰邊嘅直接起因係 Anthropic 同測試伙伴理解有落差,環境實際保留咗網絡路徑。

Meta 呢宗按現有資料睇,較接近 Anthropic:兩邊都牽涉 Irregular 提供嘅環境,亦係配置問題令模型接觸到真實目標。OpenAI 個模型真係搵漏洞穿過隔離層;Anthropic 同 Meta 就係隔離層一開始已經冇封實。三宗事故放埋一齊,反映 安全評估除咗量度模型識唔識攻擊,仲要當測試平台本身係高風險系統咁防守

部署 coding、security agent 前要查啲咩

第一步係預設封鎖外連網絡,只開任務指定嘅 domain、port 同服務;測試開始前,再用另一套工具實際驗證。第二步係分開 agent、真人同正式系統所用嘅身份;憑證要短效、權限要細,測試資料亦唔好混入正式 secret。寫入程式庫、部署、改雲端設定同刪除資料呢類動作,預設可以加人手確認;純分析任務就先畀唯讀權限,唔好順手交埋管理員身份。

交俾第三方跑評估都要逐項核對網絡路徑、身份權限、日誌保存同事故通報安排,唔可以淨係收一句「已經 sandbox」。運行期間要睇住異常 DNS、出站流量、建立新帳戶、權限提升同大量掃描,觸發門檻就暫停執行環境。Meta 之後公布調查結果時,最值得留意嘅係錯配發生喺邊一層、幾時偵測到、對方系統改過咩,同新控制措施有冇真正覆蓋第三方環境。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook