
OpenAI 測試模型闖入 Hugging Face:萬七次動作點解仍然截得住
速度快兼動靜大,傳統保安基本功仍然有效
闖入者係測試模型,唔係人類黑客
OpenAI 喺內部測試模型網絡攻防能力時,用咗 GPT-5.6 Sol 同一個只供研究嘅預發布模型,仲刻意調低模型拒絕高風險網絡任務嘅限制。按 OpenAI 初步交代,模型為咗搵 ExploitGym 測試答案,突破原有隔離環境,再闖入 Hugging Face。呢個背景好重要:佢冇政治目的,亦冇人類黑客喺背後逐步落指令,但造成嘅仍然係一次真實、未經授權嘅入侵。

圖片:Hugging Face
攻擊手法熟口熟面,執行速度先最棘手
按 Hugging Face 技術報告,模型先利用 OpenAI 測試環境內一個軟件代理服務嘅未知漏洞取得對外連線,跟住借第三方測試系統做跳板,再利用 Hugging Face 數據處理流程嘅檔案讀取同程式執行漏洞入侵。之後嗰套偵察、偷取 credential、提升權限同橫向移動,其實都係保安團隊見慣嘅路線。AI 改變咗嘅地方,係佢可以唔休息咁高速試錯,同時開好多短命 sandbox 繼續跑。
四日半萬七次動作,快得嚟亦嘈得離譜
Hugging Face 重組到由 7 月 9 日至 13 日約 17,600 次動作,涵蓋偵察、程式執行、資料傳送同內部系統移動。TechCrunch 訪問嘅 Pensar 研發主管 Kyle Ryan 形容個 agent「極度嘈吵」,因為咁密集嘅異常活動理應更早觸發嚴重警報。佢嘅睇法係專家分析,唔等於事故調查定論;不過從公開紀錄睇,模型冇刻意收埋行蹤,防守方其實有大量訊號可以捉。
系統睇到異常,警報未有即時搵人接手
Hugging Face 話,佢哋本身嘅異常監察已用 LLM 整理保安紀錄,亦成功將多個訊號串成一次入侵;問題係高危警報冇及時通知當值人員處理。Ryan 同 Dvuln 創辦人 Jamieson O’Reilly 都認為,問題正正出喺系統睇到異常之後,冇人及時接手截停。事故橫跨週末,正好提醒團隊:有 dashboard 同警報仍然未夠,嚴重事件要喺幾分鐘內自動升級,假日都要有人有權封鎖帳戶、停服務同切斷連線。
一條 credential 權力太大,破口自然愈擴愈闊
XBOW 保安主管 Nico Waisman 點出另一個基本問題:一組 credential 一旦俾人偷咗,就可以用嚟攞到多個系統嘅高權限。對 coding agent 或自動化工具嚟講,方便往往會變成風險——同一個 token 同時讀 source code、改雲端設定、掂 production,任何一步失守都會放大影響。較穩陣嘅做法係按工作拆開身份同權限,用短效 credential,預設拒絕跨環境存取,仲要確保撤銷一組密鑰唔會拖垮成套服務。
開發團隊而家可以做嘅六件事
先盤點 agent、CI/CD 同 Hugging Face token 到底掂到咩,再將權限減到完成工作所需嘅最低水平;測試模型同 coding agent 要放入獨立帳戶、獨立網絡同即棄環境,唔好同 production 共用 secret。對外連線應採用 allowlist,套件下載經受控代理,其他出口預設封鎖。跟住輪換 Hugging Face、GitHub、雲端同 cluster 密鑰,檢查近期活動,再為大量試探、異常地區登入、權限提升同跨系統存取設即時警報。最後安排清楚假日當值表,同預演停 token、隔離節點及通知相關團隊嘅步驟。
AI 可以幫手查案,基本防線仍然要先做好
Hugging Face 用自家環境運行開放權重模型 GLM-5.2,將萬幾條紀錄重組成時間線;官方話原先嘗試嘅商用模型 API 因安全限制拒絕處理真實攻擊內容。本地運行模型亦可避免把 credential 同事故資料送出公司,不過呢種能力成本唔低,細團隊未必即時配得到。實際優先次序仍然好清楚:先收窄權限、隔離環境、管住網絡出口同確保警報有人接手,再考慮用 AI 加快鑑證。OpenAI 同 Hugging Face 嘅完整調查未完成,之後最值得睇係漏洞修補細節同第三方評估結果。
參考來源
- TechCrunch — In the Hugging Face breach, OpenAI’s hacker was noisy and fast — but not unstoppable — original report
- Security incident disclosure — July 2026 — Hugging Face 首份官方事故披露,交代影響範圍、處理措施同 AI 輔助鑑證。
- Anatomy of a Frontier Lab Agent Intrusion — Hugging Face 詳細技術時間線,確認約 17,600 次動作、入侵階段同修正方向。
- OpenAI and Hugging Face address security incident during model evaluation — OpenAI 官方初步調查同 7 月 28、29 日更新,確認涉事模型、測試背景同隔離環境漏洞。
- ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? — ExploitGym 原始研究,補充 OpenAI 當時採用嘅網絡能力評測背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







