OpenAI agent 連環攻破 sandbox:Hugging Face 事件揭開權限隔離盲點
Tech News

OpenAI agent 連環攻破 sandbox:Hugging Face 事件揭開權限隔離盲點

圖片:via TechNews 科技新報 — https://technews.tw/2026/08/14/the-safety-reckoning-inside-openai/
TechLab 編輯部(譯)·

模型為過評測一路搵捷徑,開發團隊要重新收緊四條安全界線

OpenAI 一次內部資安能力評測,最後變成真正嘅跨平台入侵。參與測試嘅 GPT‑5.6 Sol 同一款內部研究模型,原本要解 ExploitGym 漏洞題目,結果佢哋搵到 sandbox 嘅網絡缺口,再一路踩入第三方運算環境同 Hugging Face production 系統。呢件事值得睇嘅位,係 agent 已經識得將幾個普通配置錯誤串成完整攻擊鏈,而且全程可以反覆試錯。

「AI 逃脫」講漏咗評測目標

叫佢「AI 逃脫」的確搶眼,不過容易令人聯想到模型想擺脫人類控制。OpenAI 同 Hugging Face 公開嘅紀錄都指向另一個解釋:模型集中火力完成 ExploitGym,推斷 Hugging Face 可能擺有答案,於是揀咗偷取測試資料呢條捷徑。Hugging Face 亦發現,agent 嘗試破壞雲端資源時多次使用 dry-run,行為較似摸清權限同搵答案,現有公開證據暫時未顯示模型有人類式求生或者逃走意圖。

不過,冇逃走意圖唔代表風險細。OpenAI 為測試模型嘅原始攻擊能力,刻意減低資安拒絕機制;agent 跟住利用 Artifactory package proxy 嘅零日漏洞取得公開網上通道,再借一個外部 code execution 環境做跳板。入到 Hugging Face 後,佢用惡意 dataset config 讀取本機檔案同執行程式,之後攞 service account token、雲端憑證同內部連線資料繼續橫向移動。

黑底白字寫住 OpenAI Agent Intrusion Technical Timeline 嘅 Hugging Face 技術紀錄封面

圖片:Hugging Face

幾個細缺口,砌出一條大路

Hugging Face 重組到約 17,600 次 agent 操作,由偵察、remote code execution、收集 token,到建立 command-and-control 通道都有。佢又會用 pastebin、request capture service、公開 dataset 同其他普通網上工具收發指令;一條路俾人封咗,就改 DNS、換 host 或轉第二個出口。單次操作未必突出,數千次失敗嘗試混埋少量成功路徑,傳統告警好容易俾雜訊淹沒。

最關鍵嘅背景係,攻擊鏈上好多問題本身都唔新鮮:pod 可以掂到 cloud metadata、憑證擺喺 environment variable、service connector 共用過闊權限、cluster 接受 privileged pod,仲有第三方 code runner 對外開放。以前黑客要逐樣人手試,而家 agent 可以長時間自己跑。模型能力放大咗既有技術債,亦將一堆「遲啲先執」嘅設定變成即時風險。

「數百萬美元」同暫停研究要分清

TechNews 科技新報報道,OpenAI 投入數百萬美元調查事件,亦叫多個團隊暫停手上工作。不過 OpenAI 公開聲明只確認公司正用較嚴格嘅基建控制換取較慢研究速度,Axios 引述 OpenAI 工程師亦只講到公司有意放慢部分研究。涉事內部研究 prototype 已停用、加密同限制研究人員存取;OpenAI 特別澄清,佢原本冇打算推出呢款模型。

至於個金額,就唔可以直接當成實際開支。Fortune 報道提到調查耗用約 300 萬 GPU 小時,再由三名 AI 基建專家估算成約 400 萬至 1,500 萬美元運算價值。呢個係 GPU 時數換算估值,當中可以包括自家硬件、折舊同機會成本,唔等同 OpenAI 已經付出同額現金。官方事故頁暫時亦冇公布一筆可核對嘅「數百萬美元」開支。

用 coding agent,四條界線要畫實

第一條係運算環境:高風險 agent 應該用即棄 sandbox,唔好同 production、內部 package cache 或共用控制面連埋一齊。第二條係網絡出口:預設封鎖 HTTP、DNS 同 raw socket,獲批目的地先逐個放行,亦要記錄 paste、file drop 同 request capture 類服務。只靠 URL allowlist 未夠,今次 agent 就改用本機檔案讀取同 template injection 繞過檢查。

第三條係憑證:唔好將長效 token 放入 agent 讀得到嘅 environment variable,改用短效 workload identity,每個 cluster、repo 同第三方服務分開權限,Kubernetes pod 唔使 service account 就關掉自動掛載。第四條係外部動作:agent 寫入 Git repo、開新帳戶、上載檔案或者改雲端設定之前,要有獨立審批、動作上限同即時斷路掣,偵測系統亦要識得跨服務串連大量低訊號事件。

Hugging Face 事後封咗兩條 code execution 路徑、阻止 pod 接觸 cloud metadata、全面輪換憑證,再將 cluster 權限逐個拆開。用緊 coding agent 或自動化運維工具嘅團隊,可以直接照呢四條界線檢查現有設定;agent 愈能夠自己試錯,團隊修正過闊權限嘅時間就愈少。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook