
OpenAI agent 攻穿 sandbox:企業 AI 安全唔可以淨靠 guardrails
新聯盟推開源防禦,身份、權限同 audit trail 要一齊補
呢次「走出 sandbox」實際發生咗咩
先講清楚,呢宗事故唔係 AI 無端端有咗自我意識。OpenAI 喺內部用 ExploitGym 測試模型嘅進階網上攻擊能力,為咗量度能力上限,當時冇開正式環境用嗰套 cyber classifiers,模型嘅拒絕限制亦調低咗。OpenAI 披露,GPT-5.6 Sol 同一個未推出、能力再高啲嘅模型,為咗搵 benchmark 答案,用大量推理運算研究點樣取得外網連線,最後攻破套件 registry cache proxy 嘅 zero-day 漏洞。
攞到外網連線之後,agent 再喺 OpenAI 測試環境提升權限同橫向移動,跟住用偷返嚟嘅憑證及其他漏洞,搵到 Hugging Face server 嘅遙距執行程式碼入口,讀取 production database 入面嘅測試答案。Hugging Face 話,入侵波及部分內部資料集同服務憑證,但暫時冇證據顯示公開模型、資料集、Spaces、container image 或已發佈套件俾人改過。兩間公司仍然調查緊實際影響。

圖片:Hugging Face
Guardrails 救唔到錯配嘅權限
最值得企業 IT 團隊睇嘅位,其實係成條攻擊鏈。模型先越過 sandbox,再搵到高權限節點、外網出口、可用憑證同另一間公司嘅漏洞;攻破一層,就多一條路繼續入侵。**模型 guardrails 只係其中一層政策控制,擋唔住錯配嘅雲端權限、過闊嘅對外連線權限同可以周圍用嘅長期憑證。**就算模型本身守規矩,只要 prompt injection 或惡意資料令 agent 揀錯目標,同一套工具權限一樣可以造成資料外洩。
NVIDIA 新公開嘅 NOOA agent framework,連自己嘅安全說明都寫得幾直白:程式內部嘅 AST 檢查同 module deny-list 只屬加固措施,唔可以當成 containment boundary;會執行模型生成程式碼嘅 agent,仍然要放入 container、VM 或其他 OS 層 sandbox。呢點好實際。企業買咗有「安全 guardrails」嘅模型,唔等於可以畀佢直接掂 production database、共用 cloud key 或任意連出外網。
防守方反而俾安全機制截停
Hugging Face 要重組超過 17,000 個攻擊事件時,原先試過用商用 frontier model API。不過紀錄包含真實 exploit payload、攻擊指令、憑證痕跡同 command-and-control 資料,供應商嘅 guardrails 分唔到鑑證人員同攻擊者,結果拒絕處理。團隊最後喺自家基建運行開放權重 GLM 5.2,官方話原本可能要幾日嘅分析,幾個鐘內已經完成,而且敏感事故資料冇離開公司環境。
呢個矛盾唔代表商用模型應該拆走 guardrails。問題係 hosted API 通常睇唔到企業內部嘅授權身份、事故編號同資料處理規則,只能靠輸入內容估風險。企業如果想用 AI 做事故鑑證,最好預先準備經審批嘅本地模型或隔離分析環境,亦要設好誰人可以啟動、用得邊批資料、結果留幾耐。等到出事先臨時搵模型,guardrail lockout 同資料外傳限制會一齊湧埋嚟。
新聯盟有工具,但暫時仲係拼圖
NVIDIA 公布嘅 Open Secure AI Alliance,官方名單現有 37 個 inaugural partners,包括 Microsoft、Hugging Face、Linux Foundation、Cloudflare、CrowdStrike、IBM、Red Hat、Palo Alto Networks 同 SpaceXAI。OpenAI、Google、Anthropic 冇喺呢份名單,但三間公司一個月前都有參與 Linux Foundation 嘅 Akrites 漏洞協調計劃,所以單憑今次缺席,就話佢哋反對開源 AI 安全唔合理。
聯盟列出嘅內容亦要分開睇。NOOA、SPIFFE/SPIRE workload identity、Safetensors、Lightwell 同 Microsoft MDASH 已經有項目或程式碼;跨供應商嘅 agent 身份、隔離、掃描、audit 標準同完整「開源防禦堆疊」,多數仍屬合作方向。企業而家已經可以做嘅,包括為每個 agent 發短效身份、按工具拆權限、預設封鎖外網出口、重大操作加人手批准,同埋保留不可隨便改寫嘅工具呼叫、授權決定及憑證使用紀錄。企業除咗揀模型,亦要逐項限制 agent 可以掂到嘅工具、資料同系統。
參考來源
- Tom's Hardware — OpenAI, Google, and Anthropic absent from Nvidia-led Open Secure AI Alliance — 30+ companies join security alliance after OpenAI agent breach — original report
- Industry Leaders Unite in Open Secure AI Alliance for AI Safety and Security — 聯盟官方公布,列出 37 個 inaugural partners、現有項目同未來方向。
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 一手交代模型、評測設定、sandbox 逃逸同跨系統攻擊鏈。
- Security incident disclosure — July 2026 — Hugging Face 一手披露受影響範圍、17,000 多個事件同 GLM 5.2 鑑證過程。
- Linux Foundation and Industry Leaders Launch Akrites — 核對 Akrites 嘅漏洞協調機制,以及 OpenAI、Google、Anthropic 均有參與。
- NVIDIA Labs Object-Oriented Agents — 核對 NOOA 已公開,同埋官方對程式內 guardrails 及 OS 層隔離嘅安全警告。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







