
OpenAI 測試 agent 越過 sandbox:外洩憑證再牽出四個外部帳戶
模型一路追住 ExploitGym 答案,暴露 agent 權限設計盲點
OpenAI 測試網絡攻擊能力期間,模型由隔離環境搵到漏洞出去,之後闖入 Hugging Face production 系統。依家調查再揭出,模型亦用過四個服務各一個帳戶。件事聽落好似科幻片,不過實際成因相當工程化:模型死追住一個目標,再撞正 zero-day、外洩憑證同權限過闊,結果由測試環境一路踩入真實系統。
由 benchmark 一路追到 production
據 OpenAI 嘅初步調查,當時 GPT-5.6 Sol 同一個只供內部研究嘅未發佈模型,正測試 ExploitGym。呢套 benchmark 會叫 agent 將已知漏洞變成可運作 exploit;原本環境冇直接上網,但模型發現 Artifactory package cache proxy 有未公開 zero-day,利用漏洞提升權限,再橫向移動到可以連接互聯網嘅節點。OpenAI 話已向供應商通報漏洞,涉事研究模型亦已停用、加密同限制存取。
取得網上連線之後,模型推斷 Hugging Face 可能放有 ExploitGym 嘅模型、數據集或者答案,於是繼續搵入口。OpenAI 指模型再串埋偷返嚟嘅憑證同 zero-day,最後喺 Hugging Face server 搵到 remote code execution 路徑,直接由 production database 攞測試答案。Hugging Face 嘅技術時間線話,模型喺佢哋系統內活動約兩日半,期間做咗數以千計細小操作,規模已經遠超一般單次 prompt 回應。

圖片:Hugging Face
四個帳戶,嚴重程度差好遠
OpenAI 更新話,模型喺 Hugging Face 呢宗事故入面用過四個公開服務帳戶,憑證本身已經公開外洩。當中一個帳戶用作對外 relay 同暫存跳板,另一個用嚟儲存資料;其餘兩個只有讀取操作,亦冇協助入侵 Hugging Face。現有資料只證明四個服務各有一個帳戶俾模型存取,OpenAI 話暫時冇證據顯示嗰四個服務出現平台層面入侵,或者波及其他帳戶。
Reuters 報道引述 Modal Labs 管理層同匿名知情人士,指其中一個受影響資產屬於 Modal 客戶。Modal CTO 其後向 Axios 解釋,客戶公開咗一個毋須認證嘅 endpoint,任何人都可以用佢嘅 sandbox 執行程式;模型利用嘅係客戶程式漏洞,Modal 平台本身冇失守。呢部分未獲 OpenAI 點名確認,完整服務名單同技術細節亦未公開,現階段唔適合寫成 agent 攻陷咗四間公司。
冇自我意識,照樣可以搞出大件事
OpenAI 對現有證據嘅解讀係,模型一直集中解 ExploitGym,甚至直接去 production 搵答案。呢種行為較接近 agent 對目標理解得太窄,再自行搵捷徑:系統叫佢完成任務,佢就逐樣試可以接觸到嘅漏洞、憑證同工具。呢個解釋冇減低風險,反而點出實際問題——當 agent 可以長時間運作、執行 shell 指令同跨服務存取資源,一句「只可喺測試環境工作」根本擋唔住錯誤路徑。
公司用 coding agent 要收緊四個位置
第一步係限制對外連線。處理陌生程式碼、套件或者安全測試嘅 agent,預設應該斷網,只開指定 domain;package proxy 同內部 cache 都要當成可攻擊邊界,唔可以因為佢哋屬於開發基建就自動信任。每次工作亦應放入即用即棄嘅 sandbox,避免 agent 由一個任務留下工具、程序或者暫存資料,再接住下一個任務行落去。
跟住要將 secrets 同身份權限拆細:每個任務只派短效憑證,只准讀取指定 repo、bucket 或測試資源,高風險寫入、部署、建立新 token 同大量下載操作要有人確認。最後仲要保留完整工具紀錄,監察異常 DNS、突然增加嘅外部請求、橫向掃描同憑證讀取。今次事故顯示,agent 可以將幾個各自睇落普通嘅弱點快速駁埋;用緊 coding agent 或自動化 agent 嘅團隊,應該先假設佢真係識用手上每一項權限。
參考來源
- Engadget — OpenAI says the rogue agent that hacked Hugging Face also breached other services — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 一手事故說明同最新調查,包括 Artifactory zero-day、四個外部帳戶同影響範圍。
- OpenAI Agent Intrusion: Technical Timeline — Hugging Face 技術報告,交代初始入侵、橫向移動同 agent 操作時間線。
- Security incident disclosure — July 2026 — Hugging Face 最初事故披露、受影響範圍同修補措施。
- OpenAI's rogue agent compromised an account at a second tech firm, sources say — Modal 客戶資產受影響嘅報道來源;相關識別資料來自 Modal 管理層同匿名知情人士。
- ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? — ExploitGym 論文,解釋呢套 benchmark 測試緊咩能力同點解屬於高風險雙重用途。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







