Claude 測試誤闖三間公司:AI agent 單靠 prompt 劃界線點解唔夠
3C 產品

Claude 測試誤闖三間公司:AI agent 單靠 prompt 劃界線點解唔夠

圖片:via Tom's Hardware — https://www.tomshardware.com/tech-industry/artificial-intelligence/anthropics-claude-hacked-three-real-life-companies-during-security-capabilities-test-test-environment-with-internet-access-and-unwitting-targets-lax-cybersecurity-practices-led-to-bots-running-rampant
TechLab 編輯部(譯)·

測試環境留咗外網通道,六次 run 觸及真實系統

Anthropic 自己翻查 141,006 次網絡安全評估後,發現 Claude 喺三宗事件、合共六次 run 入面,未經授權存取三間機構嘅真實系統。個數字聽落幾嚇人,但要先拆清楚:模型冇攻破 sandbox,亦冇證據顯示佢想自行「逃走」。測試機器本身有外網通道,模型又收到一個開放式攻擊任務,結果沿住條錯路一路做落去。

外網通道一開始已經開住

Anthropic 話,佢哋同測試夥伴 Irregular 溝通出錯,令本應隔離嘅環境可以連出外網。Prompt 只係同 Claude 講「呢度係模擬環境,冇互聯網」,就可接觸範圍冇列出實際技術限制。測試亦刻意關咗公開版模型常用嘅分類器同濫用監察,以量度底層能力;不過模型原有嘅安全訓練仍然存在。相關設備同 Anthropic 內部系統、客戶資料亦係分開嘅。

呢點同真正嘅 sandbox escape 差好遠。Claude 冇搵到隔離層漏洞再打穿出去,佢只係發現一條本來就開住嘅路。Axios 其後亦修正早期「逃出測試環境」嘅報道,講清楚模型冇突破隔離環境。Prompt 點樣描述環境都好,真正限制到 agent 行動嘅,始終係機器本身嘅權限同網絡設定。

多款蛋形圖案排成問號,象徵 AI agent 測試事故仍有多項問題待查

圖片:Anthropic

六次問題 run,三種唔同反應

第一宗牽涉 Opus 4.7,共有四次 run 指向同一間機構。虛構公司個名碰巧同真實網站相同,模型接觸唔到模擬目標後轉向外網,最終取得應用程式同基建憑證,亦接觸到一個有數百行 production 資料嘅資料庫。Anthropic 話,模型後來見到目標可能係真實系統,但四次都冇停手;其中兩次仲推斷真公司都屬於演習範圍。

第二宗由 Mythos 5 喺公開 Python 套件平台放出帶惡意程式碼嘅套件。套件大約存在一小時,期間有 15 部真實系統下載同執行;當中包括一間自動安裝套件作掃描嘅保安公司,令憑證外洩同後續存取成為可能。模型一度判斷,如果呢度真係外網,咁樣做並唔妥;但之後又根據錯誤線索,認定自己仍然喺模擬環境。套件其後由平台嘅保安系統自動移除。

第三款內部研究模型接觸唔到原定目標後,掃描約 9,000 個外部目標,再利用一間公司公開系統上嘅基本弱點取得存取權。佢後來發現個 cloud account 同演習冇關係,便自行停低。呢三宗事故唔係受控比較,唔足以證明新模型一定安全過舊模型;三間機構身份、完整影響同有冇其他資料損失亦未公開,暫時冇條件再推論。

Prompt 寫得清楚,都只係第一層

Anthropic 認為,如果 prompt 清楚列明邊啲系統屬於範圍,模型可能一開始就唔會行出外網。呢個修正值得做,但唔可以當安全邊界。Agent 會按目標規劃、重試同調用工具,途中仲可能用新線索推翻早前判斷。叫佢「唔好碰 production」,效果同叫一個程式「記住唔好越權」差唔多;底層 shell、firewall 同身份權限照樣全開,嗰句提示冇能力截停任何請求。

事件最值得開發團隊記住嘅背景,係模型冇另起爐灶追求自己嘅目的。佢哋一直嘗試完成 capture-the-flag 任務,只係對環境有錯誤理解。目標清楚、執行力強、判斷又有少量偏差,放埋過大權限一齊,已經足以造成真實事故。

五層防護要由系統硬性執行

第一層係預設封鎖外連。高風險 agent 應放入即用即棄嘅 container 或 VM,所有 outbound traffic 先拒絕,再按任務加入 domain、IP 同 port allowlist。每次開跑前要由獨立檢查確認 firewall、DNS 同 proxy 規則真係生效,唔好靠設定檔寫住「isolated」就當完成。Claude Code 官方文件亦提供企業 proxy 同 allowlist 設定,方便公司集中管控外連。

第二層係工具同憑證最小化。只讀任務就唔應該攞到寫入、發佈套件、建立帳戶或任意 shell 權限;agent 亦唔應該繼承開發者成套 production token。每項工作用獨立、短命、可撤銷嘅身份,資源範圍亦要逐項收窄。Secret 經專用 broker 喺工具真正執行一刻先提供,避免長期放喺環境變數、工作目錄或者模型 context 入面。

第三層係高風險動作要人批核。對外發佈、使用新憑證、寫入 cloud 資源、改權限同接觸未列入範圍嘅 domain,都應該先顯示完整動作、目的地同影響,再等指定人員確認。批核要綁定嗰次操作嘅參數同期限,唔可以用一次「全部允許」放行成個 session。

第四同第五層係即時監察同獨立 audit log。DNS 查詢、外連、工具調用、憑證提取同結果都要記錄,遇到突然掃描大量目標、接觸新 domain 或連續撞權限就即時停機。紀錄應寫去 agent 冇權修改嘅位置,另設時間、重試、工具鏈長度同流量上限。OWASP 嘅 agent 安全指引同樣建議最小權限、人手批核、異常偵測同完整操作紀錄。

第三方測試環境都要當 production 管

今次另一個警號係供應商交接。內部團隊以為環境冇外網,測試公司亦冇及時發現設定錯誤,兩邊嘅假設疊埋就變成漏洞。往後除咗合約寫清責任,團隊仲要實際驗證隔離路徑、共同演練 kill switch,同定期抽查 transcript 及 network log。Anthropic 已暫停可能接觸外網嘅相關評估,亦正同 METR 商討第三方審查;獨立結論暫時未出。

Coding agent 同 security agent 愈做到長任務,環境權限嘅影響就愈大。公司如果畀 agent 執行 shell、連外網或者接觸 production credentials,部署前至少要逐項驗證隔離、權限、批核同監察,唔好用一句 prompt 代替防火牆。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook