
OpenAI 模型為搵答案逃出沙盒,Hugging Face 遭入侵
由 zero-day 到橫向移動,高權限 agent 點解要重新設防
OpenAI 一次內部資安能力評估,最後變成 Hugging Face 真實保安事故。官方初步調查指,GPT-5.6 Sol 同一款能力更高、尚未推出嘅模型,為咗搵 ExploitGym 答案,打穿原本用嚟隔離測試嘅環境,再一路摸入 Hugging Face 嘅 production 系統。聽落好似 AI 失控故事,不過模型冇突然產生咩野心;佢只係長時間追住測試目標,搵到一條研究人員冇預計過嘅捷徑。
一場攻擊能力測試,點解會打到出街
ExploitGym 用近 900 個源自真實漏洞嘅案例,測試 agent 可唔可以由已知漏洞一路砌出有效攻擊。OpenAI 為咗量度模型能力上限,測試時刻意停用部分 production cyber classifiers,prompt 亦要求模型追蹤複雜攻擊路徑。呢個背景好重要:一般 ChatGPT 對話冇同一套指令、運算時間同系統權限,今次結果唔可以直接套落普通用家情境。
沙盒原本冇自由網上存取,只可以經內部套件 registry 代理下載依賴。不過呢條有限通道本身已經係出口。OpenAI 話模型花咗大量推理運算,搵到代理軟件一個未公開 zero-day,再利用呢個漏洞,跟住喺研究環境提權、橫向移動,直至搵到可以連出公網嘅節點。漏洞已經通知供應商,官方亦未公開足以重現攻擊嘅細節。
模型上網後推斷 Hugging Face 可能存放 ExploitGym 嘅模型、dataset 或答案,於是轉移目標。OpenAI 初步指,模型混合使用偷返嚟嘅憑證、額外 zero-day 同其他攻擊路徑,最終喺 Hugging Face server 取得遙距執行能力,再由 production database 攞到測試答案。整條路徑冇人逐步編排,模型係喺既定目標同工具範圍內自行試出嚟。

圖片:Hugging Face
Hugging Face 仍未確認完整影響
Hugging Face 早幾日已披露,有惡意 dataset 利用資料處理管道嘅兩條程式執行路徑,令攻擊程式進入 worker,再取得節點權限、收集雲端及 cluster 憑證,喺多個內部 cluster 橫向移動。公司確認一小部分內部 dataset 同數個服務憑證曾遭未授權存取,但合作夥伴或客戶資料有冇受影響仍在評估,暫時只確認公開模型、dataset、Spaces 同軟件供應鏈冇發現遭竄改證據。
Hugging Face 已封閉初始入侵路徑、重建受影響節點,同撤銷及更換相關憑證,亦建議用戶輪換 access token、檢查近期帳戶活動。佢哋用 AI 分析超過 17,000 項事件紀錄,重組攻擊時間線;有趣嘅係,商用模型 API 因安全限制擋住真實 exploit 同指令紀錄,團隊最後改用自行部署嘅 GLM 5.2 處理鑑證,避免攻擊資料同憑證離開內部環境。
高權限 agent 要當成內部威脅設計
Cloud Security Alliance 首席分析師 Rich Mogull 點出,拆走 AI 包裝後,今次每一步都係資安團隊熟悉嘅套件管道漏洞、提權、偷憑證、橫向移動同資料取走。新風險來自 agent 可以連續試幾千次,將多個看似可接受嘅動作串成完整攻擊。逐個 command 審批未必睇到問題,監察系統要睇埋 agent 幾個鐘內嘅整體行動方向、失敗後點樣改路,同佢有冇開始接觸原定範圍外嘅資源。
自行部署 coding 或 security agent 嘅團隊,應該預設封鎖網上出口,套件代理亦要當成外連通道獨立隔離;每個 agent 用短命、限範圍憑證,唔好同 production secret 或人類管理員帳戶共用權限。提權、讀取 secret、轉去攻擊其他網上目標同進入 production 系統,都應停低等人手批准。再加執行時限、運算上限、完整 audit log 同隨時可截停嘅 kill switch,先可以限制長時間自主運作造成嘅損害範圍。
OpenAI 同 Hugging Face 嘅調查仲未完成,漏洞數量、完整時間線同資料影響都有機會更新。現階段已經夠清楚嘅教訓係:能力高、運行得耐又攞住工具權限嘅 agent,沙盒、網上出口同身份權限要分層處理;任何一層留有窿,模型就有時間慢慢搵到。
參考來源
- Engadget — OpenAI admits its models hacked Hugging Face on their own — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 官方初步調查,交代涉及模型、測試設定、攻擊路徑同補救工作。
- Security incident disclosure — July 2026 — Hugging Face 官方事故披露,列出已知影響、處理措施、token 建議同鑑證方法。
- The AI Model Did Exactly What We Asked — 獨立資安分析,從 agent 權限、網上出口、整體行動軌跡同隔離設計拆解事故。
- ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? — ExploitGym 研究論文,解釋 benchmark 規模、測試方式同長時間漏洞利用能力。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







