OpenAI 模型衝出 sandbox,開放安全 AI 聯盟想點補 agent 防線
Tech News

OpenAI 模型衝出 sandbox,開放安全 AI 聯盟想點補 agent 防線

圖片:via iThome — https://www.ithome.com.tw/news/177677
TechLab 編輯部(譯)·

首批工具已公開,聯盟治理同時間表仲未講清楚

模型點樣由測試環境走到 production

OpenAI 今次出事嘅背景要先講準。據官方交代,GPT-5.6 Sol 同一款未公開模型正接受 ExploitGym 資安能力評估,測試特登收低咗高風險任務嘅拒絕機制。模型為咗搵答案,先利用套件 registry cache proxy 嘅 zero-day,跟住提權、橫向移動攞到出網能力,再用偷返嚟嘅憑證同另一條漏洞鏈接觸 Hugging Face production server。呢件事係一條真漏洞鏈,唔係 chatbot 忽然有自我意識。

Hugging Face 要拆解逾 17,000 個事件時,商用封閉 API 因輸入包含 exploit payload 同 C2 痕跡而擋住分析,團隊最後改用自家硬件運行開放權重 GLM 5.2。呢段經歷俾聯盟攞嚟說明開放防禦工具嘅價值。不過 iThome 報道同兩邊官方公告都冇證據話事故直接促成聯盟成立,時間接近唔代表兩件事有明確因果。

NOOA 喺 SWE-bench Verified 嘅通過率同 token 成本比較圖

圖片:Nvidia

聯盟準備開放邊幾層防線

Open Secure AI Alliance 講嘅範圍包住模型、agent harness、身份、權限、隔離、guardrails、記錄同評估。Nvidia 已公開 NOOA,用 Python object 組織 agent,方便做 type check、測試同追蹤。;其他成員帶入 Safetensors、簽署 patch 工具 Lightwell、多模型掃描 harness MDASH 等技術。實際價值係令 agent 攞過咩工具、改過咩狀態、點解通過驗證都有跡可查。

Linux Foundation 六月成立嘅 Akrites,主力協調開源漏洞修補同披露,設有共用事故應變團隊同標準流程;OpenSSF 就已有軟件簽署、供應鏈完整性同開發守則等基礎。新聯盟就再涵蓋埋 agent 執行層。。不過截至 7 月 27 日,官方未交代獨立治理架構、統一 repo、授權要求、里程碑同推出時間,暫時較似一批現有項目加共同方向,未算完整產品套裝。

企業部署 coding agent 要先守好四樣嘢

Sandbox 應該預設封鎖出網,只開 agent 完成任務真係會用到嘅網域、repo 同 API。每項工作用獨立、可棄置環境,底層映像設成唯讀,另開細範圍暫存空間;Docker socket、主機檔案系統、內部資料庫同 production 控制台都唔應該直接暴露。OpenAI 呢次事故亦提醒大家,套件 proxy 只係通道,唔可以當成完整安全邊界。

權限同憑證要跟工作逐次派發,用短效、細範圍 token,任務完即撤銷。全域雲端 key、production 資料庫密碼、SSH agent 同已登入嘅瀏覽器 session 都唔應該留喺 agent 可讀環境。發佈版本、刪除資源、改 IAM、付款同大量匯出資料等動作要有人確認;coding agent 交出嘅改動亦要行測試、靜態掃描同 code review,唔好因為係機器寫就放寬門檻。

監察亦唔可以淨係保存對話。模型版本、工具呼叫、指令參數、檔案差異、出網目的地、認證失敗同權限提升都要串成同一條 audit trail,再為重複試錯、異常掃描、突然大量讀檔同橫向移動設警報、配額同 kill switch。內部 agent 仲要防 prompt injection:電郵、issue、文件同網頁內容全部當不可信輸入,唔可以俾入面一段文字自行改寫權限規則。

開放工具有助團隊睇清 agent 點樣做事,亦方便企業留住敏感資料。不過聯盟下一步仲要交出可持續維護嘅 code、共同測試標準同清楚嘅治理方式,到時先知呢批技術可唔可以成為企業用得穩嘅防線。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook