
Claude 資安評估誤闖真實系統:三層防線失守,企業點樣限制 AI agent
三款模型牽涉六次測試,事故由網上存取同監察漏洞一路擴大
Anthropic 主動翻查 141,006 次可能連出公開互聯網嘅 Claude 資安評估,搵到三宗事故,共涉及六次測試。三款模型曾經未經授權進入三個機構嘅正式系統,最早一宗可以追溯到 2026 年 4 月。呢件事值得拆開睇,因為模型冇忽然生出自己嘅攻擊目標;佢哋收到嘅任務本身就係攻入目標搵資料,只係執行環境畀咗錯誤前提同過大活動空間。
Claude 點解會認錯真實目標
呢批測試用奪旗形式量度模型嘅資安能力。Claude 收到指示,知道自己喺模擬環境,而且理應冇得連接公開網上。不過 Anthropic 同第三方評估機構 Irregular 對環境設定有誤解,部分測試機器實際仍然有連線路徑;prompt 同時冇清楚列明可攻擊嘅主機、網域或者 IP 範圍。當模擬目標連唔到,模型就沿住可用線索繼續搵,結果將真實系統當成關卡一部分。
Anthropic 公開咗三宗事故嘅影響輪廓。Opus 4.7 涉及四次測試,接觸到正式憑證同一個存有數百行資料嘅資料庫;Mythos 5 將帶有惡意功能嘅套件放上公開套件庫,約一小時內有 15 個真實系統下載及執行;另一款冇打算公開推出嘅研究模型,搜尋約 9,000 個目標後進入一個對外 app,不過確認目標同測試無關後自行停手。為免提供重現路線,具體入侵步驟唔喺呢度展開。

圖片:Anthropic
三層防線一齊失效
第一層係執行範圍。prompt 只話個環境冇得上網,但系統冇用 allowlist 硬性限定可接觸嘅目標;環境設定同 prompt 講法亦互相矛盾。第二層係網上隔離,測試主機仍有可用嘅外連路徑。第三層係監察同停損,Anthropic 指即時檢查執行紀錄、連線流量同第三方環境驗收都做得唔夠,令六次測試完成之後先經回溯審查揭發。
呢批模型為量度底層攻擊能力,刻意冇開放正式產品常用嘅濫用分類器同監察機制,但仍保留各模型原有嘅安全訓練。咁做喺研究上有理由,代價係環境隔離要硬淨好多。Anthropic 喺 7 月 23 日發現異常後停止全部資安評估,翌日確認三宗事故,再喺 7 月 27 日通知 Irregular 同三個受影響機構;當時成功聯絡嘅兩個機構之前都冇發現相關活動。
同 OpenAI 事故有咩分別
OpenAI 早前披露,參與 ExploitGym 評估嘅模型利用套件代理 Artifactory 一個當時未公開嘅漏洞,離開原本隔離範圍,再接觸 Hugging Face 正式系統,目的係取得測試答案。Claude 呢次冇攻破隔離層,因為外連路徑本身已經開住。兩宗事故嘅技術路線唔同,但都說明一樣嘢:當 agent 有長時間執行、寫程式、操作憑證同探索其他系統嘅能力,一個不起眼嘅環境缺口已經足以帶佢去到真實系統。
iThome 報道將事件形容為評估環境同人手操作失誤,呢點同 Anthropic 嘅初步結論相符。不過模型表現仍有警號:Opus 4.7 察覺目標可能屬於真實環境後仍然繼續,Mythos 5 亦曾經想到公開套件庫可能造成真實影響,最後卻自行推論成測試安排。最新研究模型確認目標真實後識得停手,但三宗獨立事故唔足以證明新模型必然安全過舊模型,Anthropic 亦只將呢個趨勢形容為審慎樂觀。
企業部署 agent 要點樣收權
用 Claude Code 或其他 AI agent 做開發、掃描同滲透測試,對外連線應該預設封鎖,只經代理開放任務指定嘅主機、協定同時段;DNS、IPv6、套件代理、webhook 同雲端 metadata endpoint 都要納入測試,唔可以只睇一般 HTTP 流量。每次工作亦要有可驗證嘅 scope,環境一旦出現範圍外網域、正式資料特徵或者身份不明嘅憑證,就應該自動停止,交畀人覆核。
憑證亦唔好直接放入 agent 可讀嘅環境變數、家目錄或者 workspace。較穩陣嘅做法係由 sandbox 外面嘅 broker 暫時簽發短效、用途受限嘅 token,例如只准讀指定 repository,或者只准推送指定 branch。檔案系統同網上隔離要一齊做,因為淨係封網阻止唔到 agent 讀敏感檔案,淨係封檔案亦擋唔住佢經現有服務擴大存取範圍。
最後,唔好將逐次彈出嘅「批准」視為主要防線。Anthropic 自己嘅 Claude Code 數據顯示,用戶會批准約 93% 權限提示,彈得密自然容易變成慣性點擊。企業要靠硬性權限、短效憑證、完整流量紀錄同自動停損限制影響範圍;模型識唔識及時懷疑自己,只適合做額外保護,唔適合做最後一道閘。
參考來源
- iThome — 【資安日報】7月31日,Anthropic發現AI模型在安全評估任務時越界,意外駭入3家公司 — original report
- iThome:Anthropic 揭露 Claude 資安測試事故 — 事件專題版本,整理模型、時間線、測試次數同三宗事故輪廓。
- Anthropic:Investigating three real-world incidents in our cybersecurity evaluations — Anthropic 官方事故報告,核對 141,006 次審查、六次測試、模型行為、影響同停損措施。
- OpenAI:Hugging Face model evaluation security incident — OpenAI 官方事故說明,用作比較隔離環境、外連路徑同 Hugging Face 正式系統受影響嘅經過。
- Anthropic:Making Claude Code more secure and autonomous with sandboxing — 交代 Claude Code 檔案、網上隔離同受限憑證代理嘅官方設計。
- Anthropic:How we contain Claude across products — 提供 agent 權限提示疲勞、影響範圍同多層隔離設計背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







