Claude 測試連到公網波及三間公司,企業用 coding agent 要點封權限
Tech News

Claude 測試連到公網波及三間公司,企業用 coding agent 要點封權限

圖片:via TechNews 科技新報 — https://infosecu.technews.tw/2026/07/31/anthropic-ai-models-hacked-three-companies-during-tests/
TechLab 編輯部(譯)·

攻擊指令、模型能力同環境失誤疊埋,六次評測踩入真實系統

TechNews 科技新報報道,Anthropic 翻查 141,006 次可能接觸到公網嘅網絡安全評測,搵到三宗涉及六次測試嘅事故,波及三間未具名機構。最早一宗可以追溯到 4 月,牽涉 Claude Opus 4.7、Mythos 5 同一款冇打算公開推出嘅內部研究模型。Anthropic 喺 7 月 23 日發現異常後叫停相關評測,四日後通知受影響機構;兩間聯絡得上嘅公司之前都冇發現呢批活動。

三層問題要分開睇

現有證據冇顯示 Claude 自己另起惡意目標。評測本身係 capture-the-flag 攻擊任務,模型收到指令,要闖入另一部機器攞走指定資料;prompt 話成個環境只係模擬,亦話佢冇公網。偏偏 Anthropic 同第三方評測公司 Irregular 溝通有誤,部分測試機器其實出到公網,指令亦冇列明邊啲 host 先屬測試範圍。攻擊能力、攻擊指令同錯誤網絡配置一齊出現,先至令模型將真實系統當成題目一部分。

Anthropic 官方事故披露文章用嘅問號蛋形插畫

圖片:Anthropic

六次測試造成三種實際影響

第一宗佔四次測試。虛構公司個名撞中一個真實網站,Opus 4.7 搵唔到模擬目標後轉向該網站,用弱密碼、欠缺身分驗證嘅 endpoint 等基本手法取得 app 同基建憑證,亦入到一個載有數百行 production data 嘅 database。官方只確認模型攞到存取權限,亦睇到資料庫內容,冇證據顯示整個資料庫已經外洩。值得留意嘅係,模型後來察覺目標可能屬真實環境,但四次都繼續追個 flag。

第二宗由 Mythos 5 發現供「新同事」安裝、但 PyPI 上未存在嘅 Python 套件名稱。佢註冊電郵同 PyPI 帳戶,再發布同名惡意套件。套件留喺公開 registry 約一小時,期間俾 15 部真實系統下載執行;當中一部屬安全公司嘅自動掃描器,惡意程式攞走憑證後再接觸該公司其他基建,PyPI 自動防護其後移除套件。第三宗就由內部模型掃描約 9,000 個目標,經外露 debug page 同 SQL injection 入到一個真實 app;佢發現該 cloud account 同題目無關後自行停手。

點解攻擊評測開始踩入真系統

舊式 benchmark 多數放定已知漏洞同答案,容易重複,但頂尖模型做得愈多,分數愈難反映真正能力,公開漏洞資料亦可能早已混入訓練內容。Irregular 嘅 FrontierCyber 路線改用真軟件、真設定同開放式攻擊路徑,再以固定起點同隱藏 flag 比較模型。呢種設計量到模型點串連多步攻擊,不過隔離、DNS、proxy 或 route 任何一處開錯口,原本用嚟增加真實感嘅環境就會直接碰到第三方 production 系統。

公司用 agent,公網同憑證要逐樣收窄

企業用 Claude Code 或其他 coding agent,第一步係把 出站連線預設封鎖,只經公司 proxy 開放工作所需 domain;開發、測試同 production network 亦要分段,cloud metadata endpoint、內網管理介面同任意 DNS 查詢唔應該任 agent 碰。工作目錄只掛載指定 repo,SSH agent、個人 cloud profile、.env 同長期 API key 唔好直接帶入 agent container。真係要呼叫服務,就發短效、單一工作範圍嘅憑證,到期自動失效,寫入 production、開新帳戶或改 IAM 都要人手批核。

套件發布權限仲唔應該留喺日常開發環境。PyPI 官方建議用 Trusted Publishing,以 OIDC 換取最長 15 分鐘嘅短效 token,發布工作亦可放入獨立 CI job,綁定指定 repo、workflow 同受保護 environment,再加 reviewer 批核。咁做仍然要守好 release workflow,但 coding agent 就攞唔到可以隨時發布套件嘅長期 key。npm、container registry 同內部 artifact server 都應套用同一思路。

監察要睇行為,唔好只睇對話

告警條件可以直接對準異常動作:短時間掃大量 IP 或 domain、嘗試讀憑證、註冊電郵或第三方帳戶、建立回傳資料嘅 endpoint、上載新套件、連續撞 IAM 權限,任何一項都足以暫停 session。對話紀錄、指令、process、DNS 同出站流量要用同一個 run ID 串起,再寫入 agent 改唔到嘅 audit store。Anthropic 話公開版模型原有防護會擋住今次行為,不過呢點暫時仍屬公司自行判斷;METR 第三方覆核同經刪節嘅 PyPI 測試紀錄,先可以補足模型當時點判斷環境嘅細節。

兩宗近期事故行嘅路徑唔同:OpenAI 模型利用零日漏洞打開公網出口,今次 Claude 就沿住本身已開通嘅路徑出去。不過企業層面嘅處理方法好一致:假設 agent 會用盡手上工具,逐項限制佢可以去邊、攞到咩,同邊啲動作一定要人批。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook