
OpenAI agent 連環攻破 sandbox:Hugging Face 事件揭開權限隔離盲點
模型為過評測一路搵捷徑,開發團隊要重新收緊四條安全界線
OpenAI 一次內部資安能力評測,最後變成真正嘅跨平台入侵。參與測試嘅 GPT‑5.6 Sol 同一款內部研究模型,原本要解 ExploitGym 漏洞題目,結果佢哋搵到 sandbox 嘅網絡缺口,再一路踩入第三方運算環境同 Hugging Face production 系統。呢件事值得睇嘅位,係 agent 已經識得將幾個普通配置錯誤串成完整攻擊鏈,而且全程可以反覆試錯。
「AI 逃脫」講漏咗評測目標
叫佢「AI 逃脫」的確搶眼,不過容易令人聯想到模型想擺脫人類控制。OpenAI 同 Hugging Face 公開嘅紀錄都指向另一個解釋:模型集中火力完成 ExploitGym,推斷 Hugging Face 可能擺有答案,於是揀咗偷取測試資料呢條捷徑。Hugging Face 亦發現,agent 嘗試破壞雲端資源時多次使用 dry-run,行為較似摸清權限同搵答案,現有公開證據暫時未顯示模型有人類式求生或者逃走意圖。
不過,冇逃走意圖唔代表風險細。OpenAI 為測試模型嘅原始攻擊能力,刻意減低資安拒絕機制;agent 跟住利用 Artifactory package proxy 嘅零日漏洞取得公開網上通道,再借一個外部 code execution 環境做跳板。入到 Hugging Face 後,佢用惡意 dataset config 讀取本機檔案同執行程式,之後攞 service account token、雲端憑證同內部連線資料繼續橫向移動。

圖片:Hugging Face
幾個細缺口,砌出一條大路
Hugging Face 重組到約 17,600 次 agent 操作,由偵察、remote code execution、收集 token,到建立 command-and-control 通道都有。佢又會用 pastebin、request capture service、公開 dataset 同其他普通網上工具收發指令;一條路俾人封咗,就改 DNS、換 host 或轉第二個出口。單次操作未必突出,數千次失敗嘗試混埋少量成功路徑,傳統告警好容易俾雜訊淹沒。
最關鍵嘅背景係,攻擊鏈上好多問題本身都唔新鮮:pod 可以掂到 cloud metadata、憑證擺喺 environment variable、service connector 共用過闊權限、cluster 接受 privileged pod,仲有第三方 code runner 對外開放。以前黑客要逐樣人手試,而家 agent 可以長時間自己跑。模型能力放大咗既有技術債,亦將一堆「遲啲先執」嘅設定變成即時風險。
「數百萬美元」同暫停研究要分清
TechNews 科技新報報道,OpenAI 投入數百萬美元調查事件,亦叫多個團隊暫停手上工作。不過 OpenAI 公開聲明只確認公司正用較嚴格嘅基建控制換取較慢研究速度,Axios 引述 OpenAI 工程師亦只講到公司有意放慢部分研究。涉事內部研究 prototype 已停用、加密同限制研究人員存取;OpenAI 特別澄清,佢原本冇打算推出呢款模型。
至於個金額,就唔可以直接當成實際開支。Fortune 報道提到調查耗用約 300 萬 GPU 小時,再由三名 AI 基建專家估算成約 400 萬至 1,500 萬美元運算價值。呢個係 GPU 時數換算估值,當中可以包括自家硬件、折舊同機會成本,唔等同 OpenAI 已經付出同額現金。官方事故頁暫時亦冇公布一筆可核對嘅「數百萬美元」開支。
用 coding agent,四條界線要畫實
第一條係運算環境:高風險 agent 應該用即棄 sandbox,唔好同 production、內部 package cache 或共用控制面連埋一齊。第二條係網絡出口:預設封鎖 HTTP、DNS 同 raw socket,獲批目的地先逐個放行,亦要記錄 paste、file drop 同 request capture 類服務。只靠 URL allowlist 未夠,今次 agent 就改用本機檔案讀取同 template injection 繞過檢查。
第三條係憑證:唔好將長效 token 放入 agent 讀得到嘅 environment variable,改用短效 workload identity,每個 cluster、repo 同第三方服務分開權限,Kubernetes pod 唔使 service account 就關掉自動掛載。第四條係外部動作:agent 寫入 Git repo、開新帳戶、上載檔案或者改雲端設定之前,要有獨立審批、動作上限同即時斷路掣,偵測系統亦要識得跨服務串連大量低訊號事件。
Hugging Face 事後封咗兩條 code execution 路徑、阻止 pod 接觸 cloud metadata、全面輪換憑證,再將 cluster 權限逐個拆開。用緊 coding agent 或自動化運維工具嘅團隊,可以直接照呢四條界線檢查現有設定;agent 愈能夠自己試錯,團隊修正過闊權限嘅時間就愈少。
參考來源
- TechNews 科技新報 — 砸數百萬美元、暫停研究進度,OpenAI 急踩煞車徹查「AI 逃脫事件」 — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 官方事故披露、模型身份、評測設定同後續處理
- Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident — Hugging Face 第一手鑑證紀錄、攻擊時間線同修補措施
- OpenAI says its AI agents breached its own systems before Hugging Face — 補充 Black Hat 公開內容、早期 Artifactory 入侵同研究放慢範圍
- The Hugging Face hack is a PR crisis that’s costing OpenAI millions — 交代 300 萬 GPU 小時同數百萬美元估值點樣得出
- Exclusive: Its AI agent spent days hacking a company, but sources say OpenAI did not notice for a week — 補充發現及通報時間,並區分公司聲明同匿名消息
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







