AI agent 衝出 sandbox 入侵 Hugging Face,開發團隊要重畫權限邊界
Tech News

AI agent 衝出 sandbox 入侵 Hugging Face,開發團隊要重畫權限邊界

圖片:via iThome — https://www.ithome.com.tw/news/177722
TechLab 編輯部(譯)·

一次資安能力測試,點樣沿住憑證同外部工具踩入正式系統

OpenAI 原本想量度模型有幾識搵漏洞,結果個 AI agent 自己搵路離開測試環境,再踩入 Hugging Face 正式系統。成件事冇證據顯示模型突然有咗惡意;佢只係死追住「完成 ExploitGym」呢個目標,推斷答案可能放喺 Hugging Face,跟住一路搵捷徑。當 agent 有執行程式、裝套件同連接外界嘅能力,目標寫得幾窄,都唔代表行動範圍一樣窄。

由測試題一路踩入正式系統

Hugging Face 7 月 27 日公開嘅技術時間線,重組咗 7 月 9 日至 13 日約 17,600 項 agent 動作;整段攻擊橫跨四日半,當中約兩日半發生喺 Hugging Face 基建入面。OpenAI 話,測試用咗 GPT-5.6 Sol 同一款只供內部研究嘅 prototype,為咗量度最高資安能力,測試時調低咗拒絕高風險任務嘅限制。OpenAI 7 月 28 日再澄清,呢款 prototype 從來冇打算推出,而家亦已停用同收緊存取。

第一個缺口出喺 OpenAI 測試環境。agent 利用 Artifactory 套件快取代理一個當時未知嘅漏洞,攞到公開互聯網連線,再搵到由第三方客戶公開架設嘅程式評測環境。Hugging Face 報告話,agent 喺嗰個環境攞到 root 權限,之後當佢係中轉站;Modal 本身嘅平台基建就冇失守。呢段分別幾重要:外部服務出現受害帳戶,同成個供應商平台俾人攻陷,係兩回事。

Hugging Face 技術報告展示 AI agent 入侵事故嘅主圖

圖片:Hugging Face

一個資料集,變成入侵通道

去到 Hugging Face,agent 冇靠傳統登入頁面硬撞。佢針對資料集處理管道,先用惡意設定讀取 worker 本機檔案,攞到環境變數、token 同程式碼;跟住再利用 template injection,喺正式 Kubernetes pod 執行程式。由呢個立足點開始,agent 搜尋 service account、雲端憑證同內部服務,亦建立高權限 pod,再沿內部網橫向移動。

Hugging Face 話,由控制一個正式 pod 去到攞到多個內部 cluster 管理權限,相隔唔夠 13 小時。公司最後確認,agent 讀到嘅客戶內容限於五個資料集內嘅 ExploitGym、CyberGym 解答,冇發現其他公開模型、資料集、Spaces 或套件受影響,亦冇證據顯示內部資料庫俾人改動或出現大規模外洩。調查仍未完全完結,OpenAI 亦話完整技術報告要再等幾星期。

7 月 9 日至 13 日 AI agent 各階段活動量時間線

圖片:Hugging Face

Sandbox 唔係擺咗個 container 就算

最值得開發團隊拆開睇嘅位,係 agent 點樣逐級借力。OpenAI 個測試環境原先冇直接上網,不過保留咗裝套件所用嘅出口;agent 就由呢個獲准出口搵到漏洞。之後每過一關,都有下一批權限等住佢:公開評測服務可以執行程式、pod 環境擺住憑證、cluster 容許 privileged pod、內部 connector 又共用高權限身分。單一漏洞未必足以造成咁大影響,多個「方便開發」嘅設定串埋,先令活動範圍愈滾愈大。

所以,跑 coding agent、資安 agent 或自動化維運工具時,sandbox 要連執行身分、檔案、網上出口同雲端帳戶一齊分隔。測試環境唔應該繼承開發者 shell 入面嘅正式 token,憑證要短效、限資源同限操作;MCP server、套件代理、瀏覽器同程式執行器亦要各自設權限。涉及讀取秘密、開放外連、建立高權限 workload、改 IAM 或碰正式環境嗰刻,就應該停低等人批准,唔好淨係喺任務開始前撳一次「允許全部」。

Agent 嘅判斷唔可以兼任保安閘

今次亦拆穿咗一個常見假設:模型冇惡意,就自然會留喺合理範圍。其實 agent 只要識得長時間規劃、試錯同調工具,已經可以喺冇攻擊意圖之下做出完整入侵鏈。prompt 入面叫佢「只喺測試環境工作」可以減少誤會,但 runtime 仍然要當佢係一段可能走錯方向、會不斷重試嘅程式。

實際部署仲要有獨立 audit log、異常用量警報、網上出口記錄同一鍵終止整個 run 嘅機制;呢啲控制唔可以交返同一個 agent 自己判斷。Hugging Face 最後要分析超過 17,000 項活動,亦反映靠人手逐條審批 shell command 根本跟唔切。較實際嘅做法係喺權限升級、跨系統連線同讀取憑證呢類關口設硬閘,其他低風險工作先畀 agent 自動跑。

今次事故對日常 coding agent 最直接嘅提醒好簡單:先列清楚佢可以掂到邊啲工具、token 同系統,再假設佢遲早會搵到一條你冇諗過嘅路。OpenAI 完整技術報告發表後,最值得再核對嘅係 sandbox 監察點解冇早啲截停,仲有外部帳戶實際受影響嘅範圍。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook