Claude 測試誤闖三間真公司:AI agent 權限邊界點解要落喺系統層
3C 產品

Claude 測試誤闖三間真公司:AI agent 權限邊界點解要落喺系統層

圖片:via Android Authority — https://www.androidauthority.com/claude-hacked-three-real-companies-3693505/
TechLab 編輯部(譯)·

Anthropic 誤開外連,OpenAI 就真係有模型搵到 sandbox 漏洞

六次測試踩入三個真實環境

Anthropic 因應 OpenAI 同 Hugging Face 嘅事故,翻查咗 141,006 次可能接觸互聯網嘅網絡安全評估,結果喺六次測試入面搵到三宗事故,最早可以追溯到今年 4 月。三個 Claude 模型由第三方評估環境連到公開互聯網,再未經授權接觸三間機構嘅正式系統。Anthropic 暫時冇公開機構身份,相關細節主要來自公司自述,METR 就獲邀獨立覆核測試紀錄同模型行為。

最嚴重嗰宗牽涉 Claude Opus 4.7。測試方替虛構公司改咗一個同真實網站相同嘅名,模型喺模擬目標碰壁之後,沿住意外開放嘅互聯網連線搵到真公司,攞到 app 同基建登入資料,仲接觸到一個有數百行正式資料嘅 database。四次相關測試入面,模型後來都察覺目標可能係真,但仍然繼續完成 capture-the-flag 任務,呢段行為自然係成份報告最令人擔心嘅位置。

另一宗由 Claude Mythos 5 觸發。模型喺虛構文件見到一個根本唔存在嘅 Python 套件名,於是整咗個同名惡意套件,再放上真實 PyPI。套件公開約一小時,其間喺 15 部真實系統下載同執行;當中包括一間保安公司嘅自動掃描系統,令登入資料外洩,模型再用嗰批資料接觸公司其他基建。PyPI 自身保安系統其後自動移除套件,Anthropic 亦已通知 PyPI 團隊。第三宗就由內部研究模型掃描約 9,000 個目標後接觸另一間公司;模型發現個目標同測試冇關係之後,就自己停咗手。

Anthropic 同 OpenAI 兩宗事故差好遠

Anthropic 呢邊嘅測試 prompt 明確話環境冇互聯網,但 Anthropic 同合作方 Irregular 溝通出錯,加上設定失誤,測試機器其實留低咗一條可直接外連嘅路。模型接觸真實系統時,就把眼前目標當成模擬環境一部分。相關模型冇利用新漏洞逃離 sandbox,亦冇接觸 Anthropic 內部敏感系統或者客戶資料;標準產品會用嘅分類器同監察措施當時刻意關閉,因為評估目的正正係量度模型原始網絡攻擊能力。

OpenAI/Hugging Face 嗰宗就去得再遠。OpenAI 話 GPT-5.6 Sol 同一個內部研究模型身處受隔離嘅 ExploitGym 環境,原先只可以經內部套件 proxy 安裝軟件;模型搵到 Artifactory 一個未公開漏洞,突破隔離後再串連其他弱點,接觸 Hugging Face 正式基建。換句話講,Anthropic 留咗門口未閂,OpenAI 嗰批模型就搵到門鎖本身有漏洞。兩邊最後都有真實影響,但安全失效嘅成因同模型展現出嚟嘅能力都唔一樣。

冇自主惡意,照樣可以造成真傷害

Anthropic 話冇證據顯示 Claude 自己另立目標,亦冇模型嘗試複製或者帶走自己。佢哋收到嘅任務本身就係入侵系統搵旗幟,只係對環境判斷錯誤。呢點可以拆走「AI 覺醒後主動攻擊公司」嗰種戲劇化講法,但唔代表行為可以輕輕帶過:Opus 4.7 見到正式環境跡象仍然繼續,Mythos 5 亦曾諗過公開套件可能傷及真人,最後卻用錯誤線索說服自己測試仍未離開模擬世界。最新研究模型識得停手係好現象,但單靠模型自己醒覺仍然太冒險。

企業用 coding agent,要當佢真係有工具權限

呢宗事故唔涉及 Claude Code 產品本身,不過教訓直接套用到 Claude Code、Codex 同其他 coding agents。Agent 一旦有 shell、套件管理器、瀏覽器、MCP 工具、雲端 API key 或 production repository 權限,prompt 寫住「唔好連外網」只係一項行為提示,控制唔到實際連線。公司應該預設封鎖外連,只開指定 domain;測試容器亦要同內部網段、正式環境同長期憑證分隔,登入資料改用短效 token,讀取、寫入同發布權限再逐項拆開。

套件發布、production 部署、建立外部帳戶同改動雲端權限呢類動作,最好保留真人批准,亦要有不可隨意改寫嘅操作紀錄、出口流量監察同即時停機能力。Anthropic 今次已經示範咗,模型可以嚴格追住任務做,同時把錯誤環境假設一路放大。用 agent 嘅開發團隊同公司 IT,下一步應該先盤點佢實際攞到咩工具、憑證同外連能力,再決定可以自動化到邊一步。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook