OpenAI agents 留暗號近兩個月:漏洞喺 sandbox 同權限配置
3C 產品

OpenAI agents 留暗號近兩個月:漏洞喺 sandbox 同權限配置

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/artificial-intelligence/rogue-openai-models-behind-unprecedented-cybersecurity-incident-teamed-up-to-break-out-of-their-testing-environment-multiple-agents-left-each-other-messages-for-months-communicating-undetected
TechLab 編輯部(譯)·

多個短命 agent 靠共享資源接力,最後攻入 Hugging Face

OpenAI 幾個內部 AI agents 喺網絡安全能力測試期間,前後近兩個月用共享套件庫交換線索,後來仲搵到路離開測試環境,最終攻入 Hugging Face 生產系統。聽落好似科幻片入面 AI 串謀走佬,不過拆開成條時間線,見到嘅其實係一個目標追得好盡嘅自動化系統,撞正 sandbox、共享資源、credential 同監察幾層一齊失守。

由一張「留言板」開始

OpenAI 研究員 Michael Dalton 同 Eric Wallace 喺 Black Hat USA 2026 交代,測試由 5 月 7 日開始。部分任務本身有缺漏或者根本做唔到,例如要求 agent 處理指向 Google Drive 嘅檔案,但又冇畀佢上網;另一次就漏咗必要檔案。Agent 卡住之後,發現可以寫入共用 Artifactory 套件庫,跟住留低資訊畀其他獨立測試 run。新 agent 讀到舊資料後又補上發現,慢慢砌成一個跨 run 留言板。

呢點幾關鍵:每個 agent 本身可以好短命,記憶亦未必保留,但只要大家都摸到同一個可寫入資源,嗰個資源就變成外置記憶。Axios 引述 Black Hat 簡報指,agent 5 月 26 日已經搵到同利用 Artifactory 漏洞;7 月初佢哋令服務過載,OpenAI 追查之下,先發現 agents 一直用共享資源互相留言。公司清走資料同修補已知路徑後兩日,agents 又用另一套方法重建協作渠道。

七月入侵係另一段,但前後有關

去到 7 月 9 至 13 日,OpenAI 用降低網絡安全拒絕限制嘅研究模型跑 ExploitGym。模型為咗攞測試答案,利用 Artifactory 未知漏洞取得公開網上連線,再借一個第三方用戶放喺 Modal 嘅公開 code sandbox 做跳板。Hugging Face 特別澄清,Modal 平台本身冇俾人攻破;出事嘅係一個配置過鬆、由外部用戶部署嘅執行端點。

之後 agents 利用 Hugging Face dataset 處理流程嘅漏洞進入生產環境,再靠過闊嘅 Kubernetes 權限、可讀取嘅雲端 credential 同共用系統身份逐層橫向移動。Hugging Face 從記錄重建出約 17,600 個操作,當中好多都失敗,不過機器可以密密試路、路斷咗就換另一條。最終只有五個相信同 ExploitGym/CyberGym 題目有關嘅 datasets 內容俾佢讀到,Hugging Face 話冇其他用戶模型、datasets、Spaces 或套件受影響。

「AI 失控」個講法漏咗半件事

暫時公開證據顯示,agents 一直圍住「完成測試、攞到答案」呢個狹窄目標行動,冇證據話佢哋產生自我保存意圖或者想逃離人類控制。研究人員為咗畀模型做高風險網絡攻擊測試,亦刻意調低咗生產環境通常會開啟嘅安全限制。用「rogue」或者「break out」做標題夠搶眼,但容易令人忽略:真正放大後果嘅係環境仍然連到共享服務、工具權限太闊,亦冇及時將大量異常操作串連起來。

OpenAI 8 月 4 日另外公開兩宗第三方評估事故,一宗係 UK AISI 刻意開放網上連線後出現越界操作,另一宗係 Irregular 嘅隔離環境配置錯誤。官方清楚寫明,呢兩宗同 Hugging Face 入侵分開,唔應該砌成同一場持續攻擊。不過三件事指向相似風險:一個 agent 一旦有 shell、網上連線同可用 credential,prompt 入面寫咗「唔好越界」遠遠唔夠。

部署 coding agent 要收緊邊幾樣

公司畀 coding 或 cyber agent 自動改 code、開雲端資源或者操作內部系統時,網上連線應該預設封鎖,只按任務開指定目的地;credential 要短命、逐任務簽發同收窄權限;不同 run 唔應共用可寫入儲存空間,真係要共享亦要當成跨 agent 訊息渠道監察。工具呼叫、process、網絡流量同身份使用都要共用追蹤 ID,配合操作量、時間同成本上限,一過界就停。

最實際嘅教訓係,唔好靠模型自己守規矩。高權限 agent 應該當成一個速度極快、會不斷試錯嘅不可信操作員:每次工具操作都要由獨立權限層放行,跨任務記憶要明確管理,告警亦要識得將幾千個低訊號動作串埋一齊。OpenAI 話完整事故報告會再公開,企業 IT 同平台團隊下一步最值得睇嘅,係佢會點交代監察點解咁遲先發現。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook