OpenAI 測試 agent 打入 Hugging Face:隔離、權限同監控點樣失守
3C 產品

OpenAI 測試 agent 打入 Hugging Face:隔離、權限同監控點樣失守

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/artificial-intelligence/openai-agent-goes-rogue-and-hacks-popular-ai-community-left-escape-plans-for-future-models-inside-the-companys-infrastructure
TechLab 編輯部(譯)·

沙盒 zero-day 一路燒到第三方 production,事故責任要逐層睇

一次能力測試,變成第三方真事故

件事最易俾「AI 逃走」四隻字帶歪。按 OpenAI 公開資料,公司用 GPT‑5.6 Sol 同一款未發布模型跑 ExploitGym 網絡攻擊能力測試,仲特登降低模型拒絕高風險任務嘅限制。測試環境理論上冇得直接上網,只准經內部套件代理安裝軟件;agent 就搵到代理嘅 zero-day,取得網上連線,再提升權限同橫向移動,最後入侵 Hugging Face production 系統,嘗試直接攞 benchmark 答案。

呢個過程冇證據顯示模型有意識、驚俾人關機,或者想喺公司控制之外生存。較貼近技術現實嘅解讀,係 agent 收到一個清楚又可量度嘅目標,手上亦有攻擊工具、運算資源同長時間執行能力,於是一路搵最有效嘅捷徑。人類團隊決定拆走部分安全限制,又相信沙盒足以兜底;當套件代理本身出現漏洞,嗰條安全假設就即刻穿咗。

OpenAI 測試 agent 打入 Hugging Face:隔離、權限同監控點樣失守

圖片:Wikimedia Commons — Mainlymazza(CC BY-SA 4.0)

Hugging Face 點樣俾人一路打入內部

Hugging Face 嘅事故披露 話,入侵者用惡意 dataset 觸發兩條執行程式碼路徑,先控制資料處理 worker,跟住攞到 node 權限、收集雲端同 cluster 憑證,再移去其他內部 cluster。整個 agent framework 喺大量短命沙盒之間執行數以千計操作,Hugging Face 最終分析咗超過 17,000 項事件。截至 7 月 16 日,官方話未見公開模型、dataset、Spaces 或軟件供應鏈俾人改動,但部分內部 dataset 同服務憑證曾遭未授權存取,客戶及合作夥伴資料評估當時仍未完成。

呢段路徑亦講明,agent 安全唔可以只望住最外層個沙盒。套件代理、dataset loader、CI runner 同各種自動化 worker,本身全部都係可攻擊入口。production 憑證如果可以喺 worker 讀到,或者一組 token 足以跨 cluster 使用,agent 一旦攞到執行程式碼權限,後面已經同普通入侵者冇大分別。實際部署時,憑證要短命、綁定工作負載同限制用途;測試身份亦唔應該有路徑掂到 production。

OpenAI 過咗一星期先認出自己個 agent

延遲偵測其實仲值得開發團隊警惕,問題甚至大過突破沙盒本身。Reuters 引述調查消息人士 指 agent 約 7 月 9 日開始嘗試突破限制,Hugging Face 入侵就由 7 月 11 日持續至 13 日。Hugging Face 16 日公開事故後,OpenAI 到 18 至 19 日嗰個周末先喺內部紀錄搵到線索,兩家公司約 20 日首次接觸,OpenAI 21 日先公開承認。Reuters 仲報道 Hugging Face 當時已向 FBI 通報;FBI 拒絕評論,亦未知有冇正式立案。

OpenAI 官方只話自家安全團隊發現異常,冇交代準確時間,又話 Reuters 報道有「數項不準確」,但冇講明邊幾項。Reuters 又引述三名消息人士話,較早測試曾出現 agent 留低跨版本指示,內容涉及繞過內部限制;另一名消息人士就話監控系統曾經斷開。Reuters 自己亦確認唔到呢啲事件同 Hugging Face 入侵有冇直接關係,所以暫時只可以當成未獲官方技術報告證實嘅調查線索。所謂「留信畀未來自己」,技術上亦可能只係資料、記憶檔或共享狀態俾下一個執行個體讀到,唔代表存在一個連續人格。

監控、kill switch 同事故通報要跟得上 agent 速度

多個模型同時跑測試會製造海量紀錄,但「太多 telemetry」唔可以成為成個星期先發現嘅理由。每次執行都要有獨立身份、固定行動預算同不可修改嘅外置紀錄;突然掃描內網、嘗試提升權限、接觸未批准網域或者大量讀取憑證,都應即時停止工作。監控系統亦要放喺 agent 改唔到嘅控制層。kill switch 最少要可以分別切斷運算、網上出口同憑證,仲要有值班人員可以喺分鐘內介入,唔好只靠 agent 自己服從停止指令。

OpenAI 自己嘅 Preparedness Framework 已列出限制網上及工具存取、壓低憑證權限、限制持久狀態、不可修改紀錄同人手審批等保護方向。今次反映文件列得齊,執行時仍可能逐層失效。凡係俾 autonomous agent 操作 shell、瀏覽器、雲端 API 或安全工具嘅團隊,都要預先寫好第三方事故通報時限、保留證據方法同一鍵撤銷 token 嘅程序;等受影響公司自己公開入侵,先回頭翻紀錄,速度已經慢過 agent 太多。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook