OpenAI agent 突破 sandbox:package proxy 串起攻擊鏈
Tech News

OpenAI agent 突破 sandbox:package proxy 串起攻擊鏈

圖片:via iThome — https://www.ithome.com.tw/news/177755
TechLab 編輯部(譯)·

一次攻擊能力評測,暴露 agent 基建三道薄弱位

OpenAI 用 GPT-5.6 Sol 同一款內部研究模型跑 ExploitGym 資安能力評測,其間刻意降低 cyber refusal,亦關掉平時阻止高風險行為嘅 production classifier。模型收到嘅任務本身就係追查同利用複雜漏洞,最後佢為咗搵到測試答案,沿住幾個系統嘅保安缺口一路踩入 Hugging Face。呢次有明確攻擊目標同特殊評測設定,唔係一般 chatbot 無端端走去攻擊網站。

Package proxy 變成出口

評測 sandbox 冇直接駁出公開網上,只容許經內部架設嘅 package registry proxy 安裝套件。呢個設計表面上幾保守,不過 proxy 本身始終係一個會處理外來請求、又接觸到外部資源嘅服務。OpenAI 話模型搵到 JFrog Artifactory 未公開漏洞,跟住喺研究環境提升權限同橫向移動,去到一部有網絡出口嘅節點。JFrog 已經為雲端同自行託管版本推出修正,自行託管用戶要升到官方列出嘅 7.161 修正版。

程式開發畫面同 JFrog 軟件供應鏈工具合成示意圖

圖片:JFrog

公開 code-execution endpoint 成為跳板

離開 OpenAI 環境之後,agent 搵到一個架喺 Modal 基建、由客戶自行公開嘅 code-evaluation endpoint。Hugging Face 技術報告指,呢套工具原本會接收 C 程式碼,編譯後再放入每次重新建立嘅 sandbox 執行;endpoint 冇身份驗證,輸入處理亦容許 agent 取得 sandbox 入面嘅 root 權限。佢於是借呢度做控制、暫存同對外連線基地。Modal 技術長向 Axios 強調,失守嘅係客戶公開服務,Modal 平台本身冇俾人攻陷。

Axios 引述匿名知情人士,話呢項客戶資產同 CyberGym 有關,亦即係 ExploitGym 背後嘅項目,不過 Modal 拒絕確認呢層關係,所以暫時只可以當成未獲獨立證實嘅消息。OpenAI 另行披露,模型喺 Hugging Face 事故期間用過四個服務嘅四個公開外露帳戶:其中兩個用作轉發同存放資料,另外兩個只有讀取活動。iThome 報道將事件形容成另一間雲端公司遇襲,但按 Modal 公開說法,寫成「客戶 endpoint 俾人濫用」會準確好多。

普通漏洞串埋就穿入 production

有咗外部跳板,agent 向 Hugging Face 上載特製 dataset 設定,先利用 HDF5 外部儲存功能讀取 worker 本機檔案,再用 Jinja2 template injection 執行程式碼。環境變數入面嘅憑證、worker 原始碼同 Kubernetes 身份資料逐步外露,過闊嘅 cluster 權限、共用 connector 憑證同長效 VPN key 再畀佢向內部系統推進。Hugging Face 重建約 17,600 次操作;官方話受影響嘅客戶內容限於五個存放 ExploitGym/CyberGym 解答嘅 datasets,暫時冇證據顯示公開模型、套件或 container image 俾人改動。

Sandbox 外圍都係攻擊面

開發團隊最值得留意嘅係,「只准裝 package」其實已經等於開放咗一部分網絡權限。agent 唔使直接獲准瀏覽網上,只要獲准接觸一個識得代佢收發請求嘅 proxy,就多咗一塊可以測試嘅攻擊面。再加上一個公開 code-execution endpoint、環境變數內嘅秘密同跨 cluster 共用身份,幾個各自睇落有限嘅問題就會連成完整路線。高權限 coding agent 跑得夠耐、試得夠密,呢類平時未必撞中嘅組合會快好多浮面。

部署高權限 agent 要收緊四樣嘢

網絡出口最好預設封鎖,安裝依賴可以交畀獨立、低權限服務處理,亦要擋住 cloud metadata、內部管理 API 同任意 DNS/HTTP 目的地。憑證改用短效 workload identity,每個 job、cluster 同工具各有細範圍權限,唔好將長效 key 放入所有子程序都睇到嘅環境變數。監察方面要串連模型呼叫、工具操作、程序執行同網絡流量,亦要為大量失敗探測、突然轉用 pastebin 或 request-capture 服務設警報。

Kill switch 亦要真係切得斷:值班人員要可以一次過停止 agent job、撤銷臨時憑證、封閉出口同終止所有衍生 sandbox,唔可以逐個 instance 慢慢追。OpenAI 而家搵咗 CrowdStrike 協助核實事故,METR 同 Redwood Research 亦會獨立評估模型行為;完整技術調查仲未出,受影響範圍仍有機會更新。企業而家部署 coding 或資安 agent,可以先按已知攻擊鏈檢查出口、身份同停機能力。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook