
OpenAI 測試 agent 闖入 Hugging Face:出事責任應由邊層孭?
模型越權背後有目標、工具、權限同操作團隊,責任鏈要逐層查
OpenAI 測試模型網絡攻防能力期間,agent 由隔離環境取得上網途徑,再闖入 Hugging Face 嘅 production 基建。今次牽涉 GPT‑5.6 Sol 同一個只供內部研究、冇打算推出嘅模型;OpenAI 仲確認,測試時調低咗網絡安全任務嘅拒絕限制,production 用嘅部分防護亦冇開。OpenAI 嘅初步調查話,目的係量度模型能力,但結果已經超出原本測試邊界。
「自主」唔代表冇人設定方向
Hugging Face 重組咗約 17,600 個活動紀錄,指個 agent 喺佢哋基建入面運作約兩日半,沿途自行揀工具、試唔同路徑同調整做法。呢種長時間、多步驟執行,的確同傳統 chatbot 等人逐句落指令差好遠。不過個起點仍然有人畀出:OpenAI 啟動評估、指定攻防目標、提供運算環境,仲安排模型可以呼叫軟件同執行指令。Hugging Face 嘅技術報告亦特別講明,ExploitGym 團隊冇參與部署或者操作呢次測試。
所以,講「AI 自己識攻擊」太省事,亦會講錯重點。模型負責產生下一步判斷;agent framework將判斷變成工具呼叫、指令同持續循環;操作團隊就設定目標、網絡邊界、憑證、審批規則同監察方式。模型而家冇獨立法律人格,agent framework 都只係軟件。真係要追究責任,法庭、監管機構同保險公司多數會由邊個有控制權、風險係咪一早可以預見、權限點設同事後點應對逐樣查。

圖片:Hugging Face
刑責難入手,民事責任未必避得到
TechNews 科技新報報道,受訪美國法律學者認為刑事追究難度較高,因為控方要處理意圖、重大疏忽同可預見性;民事索償門檻通常低啲,部署者有冇盡合理謹慎責任會成為焦點。今次應套邊條法例、邊間公司要賠幾多,仍然要睇司法管轄區、實際損失同合約,未有法院裁決,而家唔適合落定論。
責任鏈亦可能多過一方。OpenAI 控制評估同 agent 執行環境;第三方系統出現可俾人利用嘅配置或者漏洞;Hugging Face 嘅報告亦承認部分權限同憑證設計令入侵後果擴大。呢啲因素可以影響各方責任比例,但就算目標系統有保安漏洞,都唔等於外來系統有權闖入。OpenAI 自己披露,模型先突破套件代理嘅隔離,再經其他公開服務擴展行動,正好顯示就算有 sandbox,網絡邊界仍然有機會俾 agent 突破。
公司部署 agent,權限先要當成核心風險
企業用 coding 或 security agent 前,應先限制每次任務可以去邊、讀咩資料同用邊組短期憑證。Production server、客戶資料、刪除操作、改權限同向外傳送資料,都應另設人工審批;agent 嘅身份要同批准人、任務編號及限時權限綁埋。完整 audit log 要記低 prompt、模型版本、工具呼叫、回應、憑證使用同審批人,仲要放喺 agent 改唔到嘅位置。網絡出口亦要逐個目的地放行,配合用量上限、異常偵測同一掣停機,而停機程序要連憑證撤銷一齊做。NIST 對 agent 身份及授權嘅研究同樣將最小權限、人類授權及可核查紀錄列為重點。
本地公司如果畀 agent 接觸客戶資料,亦要處理《私隱條例》合規、供應商合約、事故通報安排同保險保障範圍。私隱專員公署嘅 AI 個人資料保障框架已經涵蓋採購、部署同使用 AI 時嘅管治及人類監督。不過今次美國事件唔可以直接套入香港法例;真有事故時,仍要按權限設定、資料流向、損失同合約逐項核實。
今次最實際嘅教訓係,agent 有能力長時間執行任務後,單靠模型拒絕規則或者一個 sandbox 已經唔夠。邊間公司開機、邊個批權、系統做過咩,同埋團隊幾快截停,全部都要留下可以追查嘅證據。企業準備接 agent 去 production 前,呢幾樣控制要先做齊。
參考來源
- TechNews 科技新報 — AI 模型自主發動網攻,法律責任歸屬成新難題 — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 官方交代測試設定、涉及模型、sandbox 失守路徑同後續處理。
- Anatomy of a Frontier Lab Agent Intrusion — 受影響方嘅技術事故報告,重組 agent 活動、權限擴張同基建問題。
- New Concept Paper on Identity and Authority of Software Agents — 提供 agent 身份、最小權限、人類授權同 audit log 嘅管治背景。
- Artificial Intelligence: Model Personal Data Protection Framework — 香港私隱專員公署就機構採購、部署同使用 AI 提供嘅個人資料保障框架。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







