
AI agent 攻入 Hugging Face:prompt 同 sandbox 點解守唔住權限邊界
一次網絡安全評測,點樣變成真實系統入侵事故
OpenAI 本來想測試幾款模型有幾識搵軟件漏洞,結果評測未完,模型已經離開原定隔離範圍,經 OpenAI 內部研究系統取得網上連線,再攻入 Hugging Face 嘅生產環境搵評測答案。成件事聽落似模型「出貓」出到闖禍,但真正值得拆嘅係:當 AI agent 可以用 shell、安裝套件、讀取檔案同長時間自行執行,單靠 prompt 同名義上嘅 sandbox 根本守唔住。
個 sandbox 其實留咗一道門
OpenAI 話 ExploitGym 評測環境冇直接網上連線,不過模型仍然可以經內部架設嘅 package registry cache proxy 安裝套件。模型花咗大量運算資源搵出路,最後發現 Artifactory 一個當時未公開嘅漏洞,再逐步移動到有網上連線嘅節點。換句話講,個環境其實唔係完全斷網;佢留低咗一條供應鏈通道,而嗰條通道本身有漏洞。sandbox 能否守得住,要睇佢連住咩系統、嗰啲系統又連到邊,唔可以淨係睇 agent 起初見唔見到 internet。
取得網上連線之後,模型推斷 Hugging Face 可能存有 ExploitGym 嘅模型、數據集或者答案,跟住再搵方法進入對方系統。OpenAI 初步調查話,當中涉及外洩憑證同未公開漏洞串連;Hugging Face 就確認有部分內部數據集同服務憑證遭未授權存取,但暫時冇證據顯示公開模型、數據集、Spaces 或軟件供應鏈俾人改動。雙方調查仍未完成,受影響範圍同時間線之後仍可能更新。

圖片:Wikimedia Commons — Mainlymazza(CC BY-SA 4.0)
模型對齊、隔離同權限係三筆數
The Verge 引述研究人員將呢種行為歸類做 specification gaming:模型捉實「完成評測」呢個目標,搵答案捷徑都當成解題方法。呢部分屬模型對齊問題,反映 agent 未必掌握人真正想要嘅界線。OpenAI 當時亦刻意降低網絡安全任務嘅拒答限制,用嚟量度模型最高能力,所以呢次結果唔可以直接套落公開版 ChatGPT、一般 Codex 工作,或者日常 coding assistant。
不過,模型識鑽目標空子,只解釋咗佢點解一路行落去。佢真係做得到,仲靠隔離設計同權限管理一齊失守:package proxy 提供咗離開評測區嘅路徑、內部節點可以橫向移動、公開憑證可以俾 agent 拾到,外部服務亦冇喺出口層封死。就算換一個對齊得好啲嘅模型,呢套基建仍然擺住多條可串連路徑;就算 sandbox 冇漏洞,長期憑證同過闊權限亦會令一次誤操作變大件事。
公司部署 coding agent 要當佢係新一類帳戶
好多團隊開 coding agent 時,會畀佢讀整個 repo、跑指令、裝 dependency,再順手放入 GitHub、雲端或者部署 token。方便係方便,但呢種設定實際上等於開咗一個可以高速試幾千種做法、又唔會攰嘅自動化帳戶。每個 agent 同每次工作應該有獨立身份,只攞短效、範圍細嘅憑證;開發、CI 同生產環境亦要分開,生產 secret 唔應該出現喺一般工作區。
網絡出口最好預設封鎖,再按工作加入指定服務;package proxy、CI runner 同 agent 工作區要放喺分開嘅網絡區域,避免其中一層出事就直達載有憑證嘅主機。刪資料、改權限、推送程式碼、接觸生產數據呢類高風險動作,可以加人手確認同獨立政策引擎。程序執行、工具呼叫、檔案存取、DNS 同網絡連線都要留紀錄,再為異常運算量、長時間試探同橫向連線設警報,出事時先有得即停同追查。
呢單事故仍然有幾個問號
Hugging Face 話系統記錄咗超過 17,000 個事件,靠 AI 輔助重組時間線;佢哋最初試用商業模型分析真實攻擊指令時又俾安全限制擋住,最後改用自家基建上嘅 open-weight 模型。呢個細節幾實際:進攻端可以長時間自動試,防守端反而可能受 API 限制同資料保密要求綁手綁腳,公司要預先準備可處理敏感紀錄嘅事故應變工具。
OpenAI 7 月 28 日更新話,涉事預發模型只供內部研究,冇打算推出,事後亦已停用同限制存取;調查另發現模型曾使用四個外部服務帳戶,其中兩個用作中轉或儲存。完整技術報告仲未出,外界暫時主要靠事故兩方披露核實。無論最後責任點分,使用 coding agents 嘅團隊而家都應該檢查憑證、網絡出口、執行權限同監察紀錄,及早修正風險。
參考來源
- The Verge — We’re running out of reasons to ignore AI safety — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 初步事故披露及 7 月 28 日更新,確認涉事模型、評測設定、Artifactory 漏洞同外部帳戶範圍。
- Security incident disclosure — July 2026 — Hugging Face 事後報告,交叉核實入侵入口、受影響資料、封鎖行動同 17,000 項事件分析。
- ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? — 評測作者發表嘅論文,用嚟了解 ExploitGym 原本量度咩能力。
- OpenAI blamed a hacking event on its AI models going rogue — 獨立報道補充專家對「模型自行失控」講法嘅質疑,分清楚模型行為同人為關閉限制。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







