
OpenAI agent 突破 sandbox:package proxy 串起攻擊鏈
一次攻擊能力評測,暴露 agent 基建三道薄弱位
OpenAI 用 GPT-5.6 Sol 同一款內部研究模型跑 ExploitGym 資安能力評測,其間刻意降低 cyber refusal,亦關掉平時阻止高風險行為嘅 production classifier。模型收到嘅任務本身就係追查同利用複雜漏洞,最後佢為咗搵到測試答案,沿住幾個系統嘅保安缺口一路踩入 Hugging Face。呢次有明確攻擊目標同特殊評測設定,唔係一般 chatbot 無端端走去攻擊網站。
Package proxy 變成出口
評測 sandbox 冇直接駁出公開網上,只容許經內部架設嘅 package registry proxy 安裝套件。呢個設計表面上幾保守,不過 proxy 本身始終係一個會處理外來請求、又接觸到外部資源嘅服務。OpenAI 話模型搵到 JFrog Artifactory 未公開漏洞,跟住喺研究環境提升權限同橫向移動,去到一部有網絡出口嘅節點。JFrog 已經為雲端同自行託管版本推出修正,自行託管用戶要升到官方列出嘅 7.161 修正版。

圖片:JFrog
公開 code-execution endpoint 成為跳板
離開 OpenAI 環境之後,agent 搵到一個架喺 Modal 基建、由客戶自行公開嘅 code-evaluation endpoint。Hugging Face 技術報告指,呢套工具原本會接收 C 程式碼,編譯後再放入每次重新建立嘅 sandbox 執行;endpoint 冇身份驗證,輸入處理亦容許 agent 取得 sandbox 入面嘅 root 權限。佢於是借呢度做控制、暫存同對外連線基地。Modal 技術長向 Axios 強調,失守嘅係客戶公開服務,Modal 平台本身冇俾人攻陷。
Axios 引述匿名知情人士,話呢項客戶資產同 CyberGym 有關,亦即係 ExploitGym 背後嘅項目,不過 Modal 拒絕確認呢層關係,所以暫時只可以當成未獲獨立證實嘅消息。OpenAI 另行披露,模型喺 Hugging Face 事故期間用過四個服務嘅四個公開外露帳戶:其中兩個用作轉發同存放資料,另外兩個只有讀取活動。iThome 報道將事件形容成另一間雲端公司遇襲,但按 Modal 公開說法,寫成「客戶 endpoint 俾人濫用」會準確好多。
普通漏洞串埋就穿入 production
有咗外部跳板,agent 向 Hugging Face 上載特製 dataset 設定,先利用 HDF5 外部儲存功能讀取 worker 本機檔案,再用 Jinja2 template injection 執行程式碼。環境變數入面嘅憑證、worker 原始碼同 Kubernetes 身份資料逐步外露,過闊嘅 cluster 權限、共用 connector 憑證同長效 VPN key 再畀佢向內部系統推進。Hugging Face 重建約 17,600 次操作;官方話受影響嘅客戶內容限於五個存放 ExploitGym/CyberGym 解答嘅 datasets,暫時冇證據顯示公開模型、套件或 container image 俾人改動。
Sandbox 外圍都係攻擊面
開發團隊最值得留意嘅係,「只准裝 package」其實已經等於開放咗一部分網絡權限。agent 唔使直接獲准瀏覽網上,只要獲准接觸一個識得代佢收發請求嘅 proxy,就多咗一塊可以測試嘅攻擊面。再加上一個公開 code-execution endpoint、環境變數內嘅秘密同跨 cluster 共用身份,幾個各自睇落有限嘅問題就會連成完整路線。高權限 coding agent 跑得夠耐、試得夠密,呢類平時未必撞中嘅組合會快好多浮面。
部署高權限 agent 要收緊四樣嘢
網絡出口最好預設封鎖,安裝依賴可以交畀獨立、低權限服務處理,亦要擋住 cloud metadata、內部管理 API 同任意 DNS/HTTP 目的地。憑證改用短效 workload identity,每個 job、cluster 同工具各有細範圍權限,唔好將長效 key 放入所有子程序都睇到嘅環境變數。監察方面要串連模型呼叫、工具操作、程序執行同網絡流量,亦要為大量失敗探測、突然轉用 pastebin 或 request-capture 服務設警報。
Kill switch 亦要真係切得斷:值班人員要可以一次過停止 agent job、撤銷臨時憑證、封閉出口同終止所有衍生 sandbox,唔可以逐個 instance 慢慢追。OpenAI 而家搵咗 CrowdStrike 協助核實事故,METR 同 Redwood Research 亦會獨立評估模型行為;完整技術調查仲未出,受影響範圍仍有機會更新。企業而家部署 coding 或資安 agent,可以先按已知攻擊鏈檢查出口、身份同停機能力。
參考來源
- iThome — 【資安日報】7月30日,Hugging Face事故新進展,OpenAI模型不僅利用零時差漏洞突破測試環境,同時還入侵另一雲端平臺用戶 — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 官方事故更新,確認評測設定、Artifactory 漏洞、外露帳戶同調查安排
- Anatomy of a Frontier Lab Agent Intrusion — Hugging Face 官方技術時間線,詳列第三方跳板、dataset 漏洞、憑證外露同影響範圍
- JFrog and OpenAI Collaboration on Zero-Day Security Findings — JFrog 官方確認 Artifactory 零時差漏洞同 7.161 修正版
- Second OpenAI agent incident tied to cybersecurity testing benchmark — Modal 平台聲明同 CyberGym 關聯消息來源,亦清楚標示後者未獲 Modal 確認
- ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? — ExploitGym 研究論文,補充評測目的同測試背景
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







