
Claude 測試期間誤闖三間公司:問題出喺網絡隔離同 agent 權限
評測環境錯駁互聯網,模型將真實系統當成 CTF 場景
標題嚇人,實際成因冇咁科幻
Anthropic 話,佢哋翻查 141,006 次網絡安全評測後,搵到三宗 Claude 未經授權進入真實系統嘅事件,涉及 Opus 4.7、Mythos 5 同一個未打算公開嘅研究模型。TechCrunch 用「breached」形容結果冇錯,不過好容易令人聯想到模型衝破 sandbox、走到網上自行攻擊。Anthropic 而家披露嘅證據指向測試配置出錯:環境本身留咗一條可上網嘅路,模型冇靠漏洞突破隔離。

圖片:Anthropic
Claude 以為成個世界都係試題
三次評測都係 CTF,模型收到嘅目標係喺模擬網絡入面搵出「旗幟」。評測 prompt 明講環境冇互聯網,但 Anthropic 同第三方評測機構 Irregular 溝通出錯,實際環境原來上到網。模型遇到真實網站、證書、公司系統同雲端資源時,仍然沿用「眼前一切都係試題」呢個前提。換句話講,模型執行緊人類畀佢嘅攻擊任務,只係人類對測試邊界嘅描述同實際網絡狀態互相矛盾。
三宗事件,PyPI 嗰次最值得警惕
Anthropic 官方交代,Opus 4.7 曾經將同虛構公司同名嘅真實網站當成目標,取走憑證,亦接觸到一個載有數百行 production data 嘅 database。另一宗入面,Mythos 5 將帶惡意程式碼嘅 Python package 放上真實 PyPI,package 約一小時後俾平台安全系統移除,但期間已經喺 15 個真實系統執行;當中一個自動安裝 package 作掃描嘅保安系統更洩漏咗憑證。第三個研究模型掃過約 9,000 個目標,闖入一個對外 app,後來察覺環境同 CTF 無關就自行停手。
Package registry 可以將一次誤判迅速放大
PyPI 事件反映嘅唔止係 Claude 判斷錯誤。公司嘅掃描器會自動下載、安裝同執行公開 package,於是模型一次上載動作,就經軟件供應鏈傳到多部完全冇參與評測嘅機器。Python Packaging 官方文件列出 mirror、cache 同 private index 等管理依賴嘅做法,其中 private index 配合 public index 嘅 proxy 可以減低 dependency confusion 風險。自動掃描陌生 package 時,執行環境應該冇正式憑證、冇內網權限,亦唔應該任由程式向外傳送資料。
公開版護欄唔等於測試環境安全
Anthropic 指呢批評測刻意關掉公開版會用嘅額外 classifier 同監察,目的是量度底層模型能力;模型本身嘅安全訓練仍然保留。公司聲稱公開版護欄可以擋住相關行為,但呢點暫時主要建基於 Anthropic 自述。更實際嘅教訓係,當 agent 有 shell、網絡同寫入權限,安全邊界要由基建強制執行。 Prompt 可以交代範圍,防火牆、出口 allowlist、臨時憑證、速率限制同即時告警先可以喺模型誤解任務時截停行動。
用 coding agent 嘅團隊要重新睇權限
一般開發團隊未必會叫 agent 做網絡攻擊,但 coding agent 同樣可能讀到 credential、安裝依賴、開 browser、連 production API,甚至推送程式碼。NIST 嘅 agent 工具分類就分開 read-only、受限寫入同一般寫入權限。公司可以先封鎖預設外網,只開任務指定 domain;將 repo、CI、雲端同 production 身份拆開;高風險寫入要人手批准;再保留完整操作同網絡紀錄。權限應該跟每個任務短暫批出,用完即收返。
調查仲未完,結論要留有餘地
三間受影響機構冇公開身份,Irregular 仍然調查緊,Anthropic 亦準備畀獨立評測機構 METR 檢視紀錄,所以事件範圍仍可能更新。Anthropic 已停咗可能連上互聯網嘅網絡安全評測,亦話會加強網絡驗證、即時監察同供應商檢查。現階段最清楚嘅提醒係:agent 愈有能力,測試環境愈要當成真實高風險系統管理,唔可以靠一句「你而家喺模擬環境」頂住成條安全邊界。
參考來源
- TechCrunch — Anthropic says its own AI models breached three companies during security tests — original report
- Anthropic:Investigating three real-world incidents in our cybersecurity evaluations — 事件第一手披露,交代三宗事故、評測配置、影響同補救措施。
- Axios:Anthropic's models compromised real-world systems during testing — 獨立報道確認測試環境錯誤連上網,亦清楚區分配置失誤同突破 sandbox。
- Python Packaging User Guide:Package index mirrors and caches — Python 官方包裝文件,提供受控 mirror、cache 同 private index 背景。
- NIST:Lessons Learned from the Consortium: Tool Use in Agent Systems — 提供 AI agent 工具權限、讀寫能力同受信任環境嘅分類背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







