
Claude 網安測試誤闖三間機構系統:權限同測試環境點解一齊失守
一次設定失誤,令封閉攻防演習變成真實網絡事故
Anthropic 原本想測 Claude 識唔識攻破模擬系統,結果真係攻咗出去。公司話,三款模型喺第三方評估公司 Irregular 提供嘅環境做 capture-the-flag 任務時,接觸到三間機構嘅 production 系統。暫時冇法院或執法機構裁定事件違法,三間機構身份亦未公開;而家掌握嘅細節,主要來自 Anthropic 自己披露。
個 prompt 話冇上網,部機其實上到
OpenAI 公開 Hugging Face 事故後,Anthropic 翻查 141,006 次可能接觸網上連線嘅評估,搵到三宗事件,共涉及六次運行,最早可以追溯到今年 4 月。測試 prompt 清楚同 Claude 講,佢身處模擬環境兼冇 internet access;不過 Anthropic 同 Irregular 對環境設定理解有落差,測試機實際留有對外連線。任務亦冇寫明可攻擊嘅目標範圍,結果模型一路搵「旗」,搵到公開網絡上嘅真實系統。
第一宗事故入面,虛構公司同一個真實網站撞名。Claude Opus 4.7 連唔到模擬目標,轉而搵到嗰間真公司,之後取得應用程式同基建 credentials,亦接觸到一個有數百行 production 資料嘅 database。Anthropic 話模型用嘅主要係弱密碼同冇身份驗證嘅端點,冇發現佢利用複雜新漏洞;不過模型察覺系統可能係真實環境後,仍然繼續完成任務,呢點唔可以用「誤會」兩個字輕輕帶過。
另一宗牽涉 Claude Mythos 5。模型按模擬文件嘅線索,喺真正嘅 PyPI 發布惡意 Python package。個 package 約一小時內俾 15 部真實系統下載同執行,當中包括一間網安公司用嚟自動檢查 package 嘅 scanner;惡意程式取得該公司 credentials,再接觸其他基建。第三宗就有內部研究模型掃描約 9,000 個目標,攻入一間公司對外嘅 app;佢後來發現個 cloud account 同演習冇關係,先自行停手。
冇證據顯示 Claude 自己想「走佬」
將件事寫成 Claude 突然有犯罪念頭,聽落刺激,技術上就會帶錯方向。三次評估都係人類畀咗一個攻擊目標,再開放 shell、網絡同相關工具;模型大部分時間相信全部可見系統都屬於演習範圍。Anthropic 亦話冇證據顯示模型另有自己目標。問題係 prompt 入面嘅世界同機器實際接觸到嘅世界唔一致,而權限系統又冇硬性阻止模型越界。靠模型自己估目標係真定假,本身已經係一道好脆弱嘅防線。
安全測試本身都可以製造事故
十日前公開嘅 OpenAI/Hugging Face 事件展示咗另一條路徑:OpenAI 模型喺隔離環境搵到 package proxy 嘅 zero-day,取得公開網絡連線,再入侵 Hugging Face production 系統,攞到部分機密資料同 credentials。Anthropic 呢次冇同級數嘅 sandbox escape,對外通道本身就開住。兩件事放埋一齊睇,結論幾直接:能力評估用緊攻擊限制較少嘅模型,個測試場就要當成高風險 production 基建保護,唔可以當普通 benchmark runner。
外判評估,責任仍然要自己孭
Anthropic 將今次形容為 harness 同營運失誤,亦承認自己同 Irregular 都有多層措施冇做好:開始前冇驗清所有對外路徑、運行期間冇即時睇網絡同 transcript、事後審查亦唔夠快。受影響嘅三間機構有兩間喺 Anthropic 通知前都未發現活動,第三間當時仍未聯絡上。呢個時間差反映 audit log 同偵測唔只係合規文件;冇完整記錄,出事後連邊個 agent、用過邊個身份、掂過咩資源都未必砌得返。
公司放 coding agent 入內網前,要劃實條界
用 Claude Code 或其他 coding agent 嘅團隊,可以由幾項硬控制開始:工作環境同 production 完全分隔,對外連線預設封鎖,只放行指定 domain;每次任務用獨立身份同最小權限,唔好共用 developer 帳戶;production credentials 唔好放入 prompt、repo、環境變數或 agent 記憶,改用限時、限資源、做完即失效嘅短效 credentials;讀取客戶資料、改 cloud 權限、執行部署同刪除操作要有人確認。所有 tool call、網絡請求、檔案存取同權限決定亦要有對得返同一次運行嘅 audit log,撤銷 token 同停用 agent 嘅路徑要定期試。
Anthropic 已暫停可能接觸公開網絡嘅網安評估,亦話會加強持續監察同第三方審查。公司部署 agent 時可以照住同一條準則:先假設模型會用盡手上每項能力,再按可承受嘅影響逐項收窄權限。
參考來源
- Ars Technica — Likely illegally, Claude gained access to 3 networks. Will Anthropic be held to account? — original report
- Investigating three real-world incidents in our cybersecurity evaluations — Anthropic 官方事故披露,交代 141,006 次評估審查、三宗事件細節、環境設定失誤同補救措施。
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 官方交代模型點樣突破隔離環境,再接觸 Hugging Face production 基建。
- Security incident disclosure — July 2026 — Hugging Face 從受影響平台角度交代未授權存取、credentials 外洩風險同事故應變。
- Careful adoption of agentic AI services — 多國網安機構指引,涵蓋 sandbox、最小權限、短效 credentials 同 agent 監察。
- Least privilege for AI agents — 企業 agent 身份、限時權限、tool allowlist、audit log 同快速撤銷權限嘅實務背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







