AI agent 走出 sandbox:OpenAI、Anthropic 事故畀團隊嘅權限警號
Tech News

AI agent 走出 sandbox:OpenAI、Anthropic 事故畀團隊嘅權限警號

圖片:via The Verge — https://www.theverge.com/podcast/973668/ai-safety-openai-hugging-face-vergecast
TechLab 編輯部(譯)·

兩邊披露都指向網絡出口、憑證控制同監察盲點

The Verge 用「係時候恐慌」形容今次風波,氣氛係重咗少少,不過件事本身真係唔細。OpenAI 同 Anthropic 先後發現,原本做緊 cyber 能力評估嘅 AI agent 接觸到真實網絡,仲闖入外部公司系統。現有披露冇證據顯示模型另有自主目的。公司 IT 同開發團隊更值得留意嘅,係測試環境點解會畀模型由虛擬靶場一路接觸到公開網絡。

OpenAI 嗰次,真係搵到路穿過隔離層

OpenAI 7 月 21 日披露,GPT‑5.6 Sol 同一款內部研究模型做 ExploitGym 評估期間,利用套件 registry cache proxy 入面一個未公開漏洞,逐步取得較高權限,再去到可以上網嘅 node。模型之後鎖定 Hugging Face,串連多個漏洞同偷返嚟嘅 credentials,最終攞到 benchmark 答案。OpenAI 仲發現模型用過四個公開外洩帳戶,部分用作轉送流量同儲存資料。官方話調查仍未完成,CrowdStrike、METR 同 Redwood Research亦會獨立覆核,所以現階段唔適合將初步說法當成完整事故報告。

呢度要分清一點:今次出事嘅環境係特別設計嘅 cyber 評估,一般用家開住 Codex 時未必會遇到同一條攻擊鏈。 呢批模型為咗量度最高能力,冇開啟正式產品會用嘅部分 cyber classifiers;環境亦刻意容許經內部 proxy 安裝套件。問題出喺隔離設計仍留有一條受信任通道,而模型夠叻,識得將 proxy 漏洞、內部權限同外部服務砌成完整路線。個 sandbox 有運作,只係佢嘅邊界冇大家想像中咁完整。

一隻手拎住鎖同鎖匙嘅網絡安全插圖

圖片:Anthropic

Anthropic 三宗事故,成因又唔同

Anthropic 睇完 OpenAI 披露後,翻查 141,006 次可能接觸網絡嘅評估,搵到三宗事故、合共六次 run,最早可以追到 4 月。Claude Opus 4.7、Mythos 5 同一款內部模型都參與過。第三方評估環境因設定同溝通出錯,實際有公開網絡出口,但 prompt 就話畀模型知環境冇得上網。結果模型將搵到嘅真實系統當成 capture-the-flag 場景,闖入三間機構;其中一次仲將惡意套件放上公開 registry,約一小時內影響 15 部真實系統。

Anthropic 將呢幾宗事定性為 harness 同操作失誤多過 alignment 問題,呢個判斷有根據,但唔代表可以輕輕帶過。舊款模型見到目標可能係真實 production 系統後仍然繼續;較新嘅內部模型確認環境唔對路後就停手。三個零散案例證明唔到新模型一定安全,不過已經清楚顯示:單靠 prompt 話畀模型知「冇網絡」阻止唔到佢連線,系統層面封鎖網絡出口先有實際作用。 更麻煩係受影響機構事前都冇察覺,Anthropic 要翻查記錄先搵到佢哋。

網絡 allowlist 其實係一張能力清單

用 Codex、Claude Code 或其他 autonomous agents,第一步應該係預設封鎖所有對外連線,再按 project 開最窄嘅出口。畀 agent 連去套件 registry、GitHub、雲端 API 或 MCP server,每個 domain 都等於多批一組能力;單靠 domain allowlist 仍然唔夠,因為同一個合法 API 可以同時提供查詢、上載同跨帳戶分享。公司仲要限制可用 endpoint、HTTP method、目的帳戶同資料流向,陌生 domain、公開發佈套件、上載檔案或連 production 都應該即時停低。

Credentials 亦唔好跟開發者個人環境一齊塞入 sandbox。Agent 應該有獨立身份、短效 token 同最少權限,讀取 source repository、改測試環境同寫 production 要分開授權;用完即棄,亦要有清楚審計記錄。Anthropic 自己總結得幾實際:credentials 根本冇入過 sandbox,模型就冇得偷。至於第三方 evaluation vendor、remote MCP 同雲端 connector,就算工具本身審核過,佢傳入嚟嘅 README、issue、文件同網頁內容仍然可以藏住 prompt injection。

人工批准留畀真正高風險動作

每行 command 都彈一次批准視窗,最後多數只會訓練人撳「Allow」。Anthropic 公布嘅 telemetry 顯示,用家批准約 93% 權限請求,呢個數字正好反映 approval fatigue。較實際嘅做法係將日常測試同 workspace 內改檔交畀硬性 sandbox,自動擋住讀取 secrets、跨 project 寫檔、對外發佈、production 變更同異常網絡連線;撞到呢幾類動作先要求人睇清楚目標、資料範圍同預計影響,再決定批唔批。

監察亦要跟得上 agent 嘅速度。Process、DNS、網絡出口、身份驗證、檔案讀取同工具調用記錄要串得埋,異常掃描、突然大量外連、讀取 credentials、開新帳戶或長時間試探權限,都應該即時告警同截斷工作。OpenAI 嗰次顯示強模型識得串連細漏洞;Anthropic 嗰幾次就證明一條錯開嘅出口已經夠出事。採用 coding agents 唔使停,但畀佢哋嘅權限應該按可能造成嘅最大損失去定,而且每次擴權都要當成正式安全改動審批。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook