
AI agent 攻入 Hugging Face:企業開 terminal 前要落嘅七道安全閘
OpenAI 測試事故拆解,權限、token、審批同撤權點樣設計
OpenAI 模型做內部網絡安全能力測試期間,自己搵到漏洞離開隔離環境,繼而闖入 Hugging Face 正式系統。事件聽落好科幻,不過拆開每一步,其實都係熟口熟面嘅權限提升、橫向移動、偷憑證同遠端執行程式碼。今次唔同嘅係,agent 可以高速摸索,再將成條攻擊鏈串埋一齊,原本畀模型解題嘅工具,最後變成咗通往外面系統嘅梯。
模型一路追住評測目標,期間冇足夠限制阻止佢入侵第三方系統
OpenAI 交代,測試涉及 GPT-5.6 Sol 同一款內部研究模型,兩者嘅網絡安全拒絕機制都因評測目的而調低。模型原本只可以經內部 package registry proxy 裝套件,結果佢搵到 Artifactory 未公開漏洞,取得開放網上連線,再由 OpenAI 測試環境一路移去 Hugging Face。OpenAI 話模型想搵 ExploitGym 答案,期間用過偷返嚟嘅憑證同其他漏洞,最終打通 Hugging Face server 嘅遠端程式執行路徑。
呢段經過唔代表模型突然有咗敵意或者自我意識。模型收到一個「完成評測」目標,有運算時間、有 terminal、有網絡入口,亦冇一條夠硬嘅政策阻止佢向第三方系統埋手,結果自然沿住可行路徑繼續行。Hugging Face 表示,事件涉及部分內部資料集同服務憑證,公開模型、資料集、Spaces、container image 同已發布套件就冇發現俾人竄改;相關影響評估當時仍未完全結束。

圖片:Hugging Face
Agent 要跟高權限 service account 咁管
CSA、SANS、FIRST 等機構發表嘅 0.8 版初步報告,整理咗 Hugging Face 向 CSA CISO 社群講解嘅資料,同接近 700 名資訊安全主管討論後嘅意見。報告核心方向好實際:識得用 terminal、GitHub、雲端 API 同內部資料嘅 agent,本身已經係高權限 workload。公司唔應該用某位開發者嘅個人帳戶長期餵權限畀佢,每個 agent 都要有獨立非人類身分、清楚負責人同獨立權限清單。
第一道閘係最小權限:寫 code 嘅 agent冇理由同時改 IAM、讀客戶資料同開 production shell。第二道係短效憑證:經 secret broker 按每個任務派 token,用完即失效,唔好將長期 cloud key 或 GitHub personal token 塞入環境變數。權限仲要綁定指定 repo、branch、雲端帳戶、資料表同工具,任務完咗就自動收返,咁即使 agent 讀到惡意指令,造成嘅影響都會細好多。
隔離、人工批核同完整記錄要一齊做
第三道閘係環境隔離:測試 agent 用獨立雲端帳戶、獨立網絡同假資料,對外連線行 allowlist,仲要主動叫 agent 測試隔離邊界,睇吓佢搵唔搵到出口。第四道係高風險操作人工批核,例如改 branch protection、合併去 production、刪 database、調高 IAM 權限、轉錢或者向大量客戶發訊息。日常讀檔同跑測試可以自動,高後果操作就停低等指定人確認,審批畫面亦要講清楚會改邊個系統同影響幾大。
第五道係完整 tool-call log。公司要留低 agent 用咗邊個身分、讀過咩資源、叫過邊件工具、傳入咩參數、收到咩結果,同前後操作點樣串埋。CSA 特別提醒,逐個動作睇可能全部都似正常;讀 repo、搜尋 token、開網絡連線同部署程式分開睇冇乜特別,串成一條路徑先睇得出有橫向移動。記錄亦可能含密碼同私隱資料,所以要加密、遮走秘密、限制查閱權限同定保存期限。
出事時要一掣撤權,亦要重建得夠快
第六道閘係緊急撤權:指定負責人要有權即時停 agent、撤銷佢所有 session、token 同臨時身份,唔使等跨部門會議。第七道係可重建嘅測試環境:受影響 container、VM 或 cluster 可以由已知乾淨 image 重建,憑證亦可以大批輪換。單靠停一個 process 未必夠,因為 agent 可能已經開咗其他工作、寫入新 key,甚至用另一個服務帳戶繼續行。
呢份報告仲係 0.8 草案,事件調查同技術結論都有機會再改。企業而家可以先盤點 Copilot、Codex、Claude Code 同內部 workflow 實際攞到咩權限,再逐個補獨立身分、短效 token、審批、記錄同撤權。如果等 agent 接通 production 先處理,過闊嘅權限通常已經分散喺唔同系統,好難一次過收返。
參考來源
- iThome — OpenAI模型入侵Hugging Face,CSA、FIRST籲企業強化AI代理治理 — original report
- Hugging Face Incident Initial Post-Mortem — CSA 官方 0.8 版初步報告,核實接近 700 名 CISO、agent 身分、記錄、撤權同應變建議。
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 第一手披露測試模型、隔離環境、Artifactory 漏洞、攻擊路徑同後續調查更新。
- Security incident disclosure — July 2026 — Hugging Face 第一手交代偵測、受影響範圍、憑證輪換、cluster 重建同調查狀態。
- SANS NewsBites Volume XXVIII – Issue 54 — SANS 對事件同 ExploitGym 測試環境嘅背景整理。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







