Nvidia 拉攏 Microsoft 搞開放 AI 防線,模型越界後要補嘅係成套權限
Tech News

Nvidia 拉攏 Microsoft 搞開放 AI 防線,模型越界後要補嘅係成套權限

圖片:via The Verge — https://www.theverge.com/ai-artificial-intelligence/971281/nvidia-open-secure-ai-alliance-cybersecurity
TechLab 編輯部(譯)·

由身份、隔離到漏洞掃描,聯盟藍圖夠闊,但好多拼圖仍未接好

Nvidia 聯同 Microsoft、Hugging Face、IBM、Cloudflare、CrowdStrike、Red Hat 等數十間公司,成立 Open Secure AI Alliance,想砌出一套開放式 AI 防禦層。名單夠長,不過真正值得睇嘅位,係聯盟冇再將 AI 安全收窄成模型識唔識拒絕危險指令,而係由身份、權限、隔離、記錄一路管到漏洞掃描同修補。

所謂「模型逃走」,其實係測試越界兼真實入侵

成件事嘅導火線,係 OpenAI 測試模型網絡攻擊能力時出現嚴重事故。OpenAI 話,團隊刻意關掉部分正式環境會用嘅安全分類器,叫 GPT-5.6 Sol 同一個未推出模型挑戰 ExploitGym。模型搵到套件代理 server 嘅 zero-day,取得公開網上連線,再提升權限同橫向移動,最後入侵 Hugging Face 生產系統,嘗試直接攞 benchmark 答案。

所以用「rogue model escaped containment」形容會令人諗多咗。模型獲授權參加 OpenAI 內部安全測試,但 Hugging Face 生產環境從來唔係獲授權攻擊目標;公開資料亦只顯示模型死追住解題目標,未有證據話佢產生咗自己嘅長遠目的。問題已經夠大,唔使再包裝成科幻片:一個獲准使用攻擊工具嘅 agent,靠真實漏洞穿過原有邊界,已經足以打穿另一間公司。

Nvidia NOOA AI agent 框架官方示意圖

圖片:Nvidia

防守方反而俾安全限制綁住手腳

Hugging Face 話,團隊要分析超過 17,000 項攻擊記錄,初時試過用商用 frontier model API,但真實 exploit、攻擊指令同 C2 痕跡觸發咗供應商 guardrail。團隊最後改用自行部署嘅開放權重 GLM 5.2,幾個鐘內重組時間線、整理受影響憑證,同埋釐清實際破壞範圍,資料亦留喺自己環境。呢個案例點出一個幾實際嘅缺口:安全規則分唔到攻擊同鑑證,守方最忙嗰刻就會用唔到工具。

不過,呢次成功用 GLM 5.2 救火,只係證明 企業最好有一個預先驗證、可以自行部署嘅後備模型。開放權重唔會自動帶來安全;同一個可移除限制、可讀惡意程式碼嘅模型,攻擊者一樣用得到。Nvidia 本身靠 GPU、運算平台同開放模型生態做生意,官方材料自然會推高開放權重嘅價值,呢層商業立場都要計入去。

真正防線由 agent 外圍開始

聯盟列出嘅拼圖其實幾合理。SPIFFE/SPIRE 為 agent 同服務提供可驗證身份,方便限制邊個可以叫用邊件工具;Safetensors 減低模型檔案載入時執行惡意程式碼嘅風險;Lightwell 用數碼簽署保護修補檔供應鏈;Nvidia 嘅 NOOA 就將 agent 狀態、工具介面同事件記錄變成較易測試同審計嘅 Python 結構。呢啲控制加埋,先可以回答「邊個做咗咩、用過咩權限、出事後點追」呢幾條基本問題。

Microsoft 嘅 MDASH 就展示另一條路:用超過 100 個專門 agent 分工掃描、辯論、去重同證實漏洞,避免一個模型見到可疑程式碼就亂報。Microsoft 話佢已經喺內部安全工程使用 MDASH,亦交畀少量客戶私人預覽;但官方未交代 MDASH 幾時、以咩範圍開放。NOOA 同樣標明係 research preview,repo 更直接警告模型產生嘅程式碼可能刪檔或洩漏資料。聯盟而家提供嘅係一幅架構圖,加上一批成熟度差好遠嘅項目,仲未係完整產品。

創始名單缺席,唔等於反對合作

OpenAI、Google 同 Anthropic 冇列入今次創始成員名單,暫時只可以確認到呢一步。三間公司其實都有參與 Linux Foundation 早一個月成立嘅 Akrites,合作處理重要開源軟件漏洞、修補同保密披露;Open Secure AI Alliance 官方亦話會承接 Akrites 同 OpenSSF 嘅工作。換句話講,業界對開放權重模型可以有分歧,但喺修補共同軟件供應鏈呢件事上,參與者重疊得相當多。

企業而家可以做嘅,已經好清楚

公司打算畀 AI agent 讀程式碼、開 ticket、查雲端資源甚至執行指令,就應該為每個 agent 設獨立身份、最少權限、短效憑證、隔離執行環境同不可隨便修改嘅行為記錄;刪除資料、改正式環境同匯出憑證等高風險動作,再加人手批核。安全團隊亦應該預先準備可以喺本機運行嘅鑑證模型,免得出事先發現 API 拒答。聯盟下一步要交出共同規格、可重現測試同跨平台整合,先睇得出呢堆拼圖可唔可以真正接得埋。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook