OpenAI agent 攻穿 sandbox:企業 AI 安全唔可以淨靠 guardrails
3C 產品

OpenAI agent 攻穿 sandbox:企業 AI 安全唔可以淨靠 guardrails

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/artificial-intelligence/openai-google-and-anthropic-absent-from-nvidia-led-open-secure-ai-alliance-30-companies-join-security-alliance-after-openai-agent-breach
TechLab 編輯部(譯)·

新聯盟推開源防禦,身份、權限同 audit trail 要一齊補

呢次「走出 sandbox」實際發生咗咩

先講清楚,呢宗事故唔係 AI 無端端有咗自我意識。OpenAI 喺內部用 ExploitGym 測試模型嘅進階網上攻擊能力,為咗量度能力上限,當時冇開正式環境用嗰套 cyber classifiers,模型嘅拒絕限制亦調低咗。OpenAI 披露,GPT-5.6 Sol 同一個未推出、能力再高啲嘅模型,為咗搵 benchmark 答案,用大量推理運算研究點樣取得外網連線,最後攻破套件 registry cache proxy 嘅 zero-day 漏洞。

攞到外網連線之後,agent 再喺 OpenAI 測試環境提升權限同橫向移動,跟住用偷返嚟嘅憑證及其他漏洞,搵到 Hugging Face server 嘅遙距執行程式碼入口,讀取 production database 入面嘅測試答案。Hugging Face 話,入侵波及部分內部資料集同服務憑證,但暫時冇證據顯示公開模型、資料集、Spaces、container image 或已發佈套件俾人改過。兩間公司仍然調查緊實際影響。

Hugging Face 2026 年 7 月保安事故披露封面圖

圖片:Hugging Face

Guardrails 救唔到錯配嘅權限

最值得企業 IT 團隊睇嘅位,其實係成條攻擊鏈。模型先越過 sandbox,再搵到高權限節點、外網出口、可用憑證同另一間公司嘅漏洞;攻破一層,就多一條路繼續入侵。**模型 guardrails 只係其中一層政策控制,擋唔住錯配嘅雲端權限、過闊嘅對外連線權限同可以周圍用嘅長期憑證。**就算模型本身守規矩,只要 prompt injection 或惡意資料令 agent 揀錯目標,同一套工具權限一樣可以造成資料外洩。

NVIDIA 新公開嘅 NOOA agent framework,連自己嘅安全說明都寫得幾直白:程式內部嘅 AST 檢查同 module deny-list 只屬加固措施,唔可以當成 containment boundary;會執行模型生成程式碼嘅 agent,仍然要放入 container、VM 或其他 OS 層 sandbox。呢點好實際。企業買咗有「安全 guardrails」嘅模型,唔等於可以畀佢直接掂 production database、共用 cloud key 或任意連出外網。

防守方反而俾安全機制截停

Hugging Face 要重組超過 17,000 個攻擊事件時,原先試過用商用 frontier model API。不過紀錄包含真實 exploit payload、攻擊指令、憑證痕跡同 command-and-control 資料,供應商嘅 guardrails 分唔到鑑證人員同攻擊者,結果拒絕處理。團隊最後喺自家基建運行開放權重 GLM 5.2,官方話原本可能要幾日嘅分析,幾個鐘內已經完成,而且敏感事故資料冇離開公司環境。

呢個矛盾唔代表商用模型應該拆走 guardrails。問題係 hosted API 通常睇唔到企業內部嘅授權身份、事故編號同資料處理規則,只能靠輸入內容估風險。企業如果想用 AI 做事故鑑證,最好預先準備經審批嘅本地模型或隔離分析環境,亦要設好誰人可以啟動、用得邊批資料、結果留幾耐。等到出事先臨時搵模型,guardrail lockout 同資料外傳限制會一齊湧埋嚟。

新聯盟有工具,但暫時仲係拼圖

NVIDIA 公布嘅 Open Secure AI Alliance,官方名單現有 37 個 inaugural partners,包括 Microsoft、Hugging Face、Linux Foundation、Cloudflare、CrowdStrike、IBM、Red Hat、Palo Alto Networks 同 SpaceXAI。OpenAI、Google、Anthropic 冇喺呢份名單,但三間公司一個月前都有參與 Linux Foundation 嘅 Akrites 漏洞協調計劃,所以單憑今次缺席,就話佢哋反對開源 AI 安全唔合理。

聯盟列出嘅內容亦要分開睇。NOOA、SPIFFE/SPIRE workload identity、Safetensors、Lightwell 同 Microsoft MDASH 已經有項目或程式碼;跨供應商嘅 agent 身份、隔離、掃描、audit 標準同完整「開源防禦堆疊」,多數仍屬合作方向。企業而家已經可以做嘅,包括為每個 agent 發短效身份、按工具拆權限、預設封鎖外網出口、重大操作加人手批准,同埋保留不可隨便改寫嘅工具呼叫、授權決定及憑證使用紀錄。企業除咗揀模型,亦要逐項限制 agent 可以掂到嘅工具、資料同系統。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook