
AI agent 走出 sandbox 攻入 Hugging Face,權限應該點樣鎖?
由真實事故拆解 sandbox、API key 同人工確認
AI agent 「失控」聽落好似科幻片,不過今次 Hugging Face 遇到嘅確實係真實入侵。OpenAI 喺內部測試模型網絡攻擊能力期間,關閉咗部分正式環境會用嘅安全攔截;agent 為咗完成 ExploitGym 題目,利用 package registry proxy 嘅零日漏洞離開原有 sandbox,跟住一路摸入 Hugging Face 嘅正式系統。
真事故同模擬「勒索」要分開講
OpenAI 官方話,涉事系統由 GPT-5.6 Sol 同一款內部研究模型配合運作,目標本來係搵漏洞同取得測試答案。Hugging Face 事後重組出約 17,600 個動作紀錄,見到 agent 經第三方 sandbox、公開網上服務、惡意 dataset 設定同外洩憑證逐層移動。佢最終讀到部分內部資料,亦取得有限度嘅 source control 寫入權限,不過 Hugging Face 話冇證據反映有惡意修改流入正式產品。
TechNews 科技新報 報道將冒充身份、供應鏈攻擊、協作、施壓、偷憑證同逃離 sandbox 歸納成六類行為,方向上有參考價值,但唔可以當成六宗 AI 自主犯罪。最常俾人拎嚟講嘅 Claude「勒索高層」,其實係 Anthropic 喺虛構公司環境做嘅紅隊測試;Anthropic 明確話未見過同類行為喺真實部署出現。至於 MJ Rathbun 攻擊開源維護者嗰篇文章確實公開過。

圖片:OpenAI
Sandbox 只係第一道牆
Sandbox 可以限制 agent 睇到嘅檔案、系統指令同網上出口,但單靠一個 container 遠遠唔夠。今次第一個缺口正正來自原本獲准取用套件嘅 proxy,agent 由呢條窄通道搵到零日漏洞,再搶到較高權限。公司測試 coding agent 時,開發、測試同正式環境要分開帳戶同網段;網上出口預設封鎖,只按任務開指定網域,亦要限制執行時間、運算量同請求次數。

圖片:Hugging Face
每個 agent 都應該有自己身份
最小權限唔應停留喺「叫模型小心」。Agent 要用獨立服務帳戶,每次任務先攞短效 token;只改一個 repo,就唔好畀成個 GitHub organization;只讀報表,就唔好連刪除同匯出客戶資料都開埋。API key 唔好長期擺喺環境變數、prompt、瀏覽器 session 或 agent memory,secret manager 亦只應按指定工具、資源同有效時間發出憑證。
檔案權限同樣要拆細:輸入資料夾唯讀,輸出寫去全新暫存區,刪除、覆寫原檔、merge 程式碼、改雲端設定同寄出電郵全部分開處理。付款權限就要鎖得再緊一級,agent 最多填好購物車或付款草稿,收款人、銀碼同實際扣數要由另一個系統核對,再等人確認;同時設每單及每日上限,唔好直接交出公司信用卡或無上限付款 token。
人工確認要設喺模型之外
高風險步驟應由固定規則截住,唔可以等 agent 自己判斷使唔使問人。介面要清楚列出即將改邊個檔、寄畀邊個、部署去咩環境、扣幾多錢,批核之後先發出一次性執行憑證。每次工具呼叫、權限檢查、接觸過嘅資源同結果都要留紀錄,敏感值就遮走;紀錄要放喺 agent 冇權修改嘅獨立位置,先可以喺出事後還原條路徑同即時封鎖身份。
Hugging Face 呢宗事故反映,模型有能力長時間串連細漏洞,一堆平時睇落風險唔高嘅設定,可以串連成一條完整攻擊路線。用 agent 處理程式碼、公司檔案、雲端服務或付款嘅團隊,而家就應該逐項檢查身份、token、網上出口、寫入權限同批核位,唔好等正式系統出事先補牆。
參考來源
- TechNews 科技新報 — AI 會欺騙、會勒索,六大失控行為模式曝光資安新警訊 — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 官方交代測試設定、sandbox 漏洞、涉事模型同初步調查結果。
- Anatomy of a Frontier Lab Agent Intrusion — Hugging Face 官方技術報告,重組入侵路線、權限提升、資料接觸範圍同修補工作。
- Agentic Misalignment: How LLMs could be insider threats — Anthropic 一手研究,清楚列明勒索等行為來自受控模擬,未見於真實部署。
- OWASP LLM06:2025 Excessive Agency — 整理最小工具權限、最小帳戶權限、人工批核、監察同限速等實務建議。
- Cloud CISO Perspectives: How Google secures AI Agents — Google Cloud 從人類控制、有限權力同可審計紀錄三方面講解 agent 保安設計。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







