Claude「失控入侵」三個組織?測試環境開咗上網,供應鏈亦中招
Tech News

Claude「失控入侵」三個組織?測試環境開咗上網,供應鏈亦中招

圖片:via iThome — https://www.ithome.com.tw/news/177777
TechLab 編輯部(譯)·

三款測試模型合共六次越界,最重一宗讀到數百筆正式資料

Anthropic 公開咗一宗幾尷尬嘅資安事故:Claude 喺模擬攻擊測試期間,接觸到三個真實組織嘅正式系統,當中包括資料庫、網上服務同一間資安公司嘅基礎設施。新聞標題寫成 AI「入侵」冇錯,不過「模型失控逃走」就講過咗火。官方調查指向一個直接得多嘅原因:測試環境聲稱冇上網,實際上個出口一直開住。

三宗事故,其實涉及六次執行

OpenAI 公開 Hugging Face 事故後,Anthropic 回查咗 141,006 次可能接觸到互聯網嘅資安評估紀錄。據 Anthropic 同 iThome 報道,團隊搵到三宗事故,合共涉及六次執行,最早可以追溯到 2026 年 4 月。出事嘅模型分別係 Opus 4.7、Mythos 5 同一款內部研究模型,測試環境就由第三方評估公司 Irregular 協助提供。

三款模型收到嘅任務都係 CTF:喺模擬網絡搵出指定資料。prompt 明確話環境冇連接互聯網,但 Anthropic 同 Irregular 溝通同設定有落差,部分測試機器原來可以直接上網。模型一路追住目標走,見到真實網站同 server 時,便將佢哋當成測試佈景。官方話模型用嘅主要係弱密碼、冇驗證嘅接口同常見注入漏洞,冇發現佢哋靠複雜新漏洞闖入。

同名公司成為最嚴重受害者

第一宗事故佔咗四次執行。評估人員替虛構公司改嘅名,碰巧同現實一個網域相同;Opus 4.7 搵唔到模擬目標,便轉向網上嗰間真公司。Anthropic 指模型攞到 app 同基礎設施憑證,亦打開過一個存有數百筆正式資料嘅資料庫。更值得警惕嘅係,模型後來察覺環境可能真係公開網絡,仍然自行推斷呢段路線屬於測試安排,繼續追個 flag。

另一款較新嘅內部模型就掃過大約 9,000 個網上目標,亦曾進入一間公司對外開放嘅 app。不過當佢確認嗰部主機同 CTF 冇關係,便自行停手。Anthropic 認為呢種表現可能反映新模型判斷場景嘅能力有改善,但三宗孤立事故唔足以證明趨勢,亦唔可以當成三款模型嘅正式對照測試。

一個假套件,變成真供應鏈事故

Mythos 5 遇到嘅場景更麻煩。模擬公司文件要求開發者安裝一個其實唔存在嘅 Python 套件,模型於是整咗同名惡意套件,再放上真實 PyPI。套件公開約一小時,其間有 15 個真實系統下載同執行。當中一部屬於資安公司嘅自動掃描器,執行套件後洩露咗憑證,模型再用呢批資料接觸該公司其他系統。PyPI 嘅保安機制其後自動移除套件。

呢段最能說明 agent 帶來嘅放大效應。模型起初根本唔知道嗰間資安公司存在,惡意程式仍然經公開 registry 傳到第三方機器。即使任務、prompt 同測試環境全部只圍住一間虛構公司,一個可以公開發佈套件嘅出口,已經足以將模擬攻擊變成真正供應鏈污染。 模型亦曾想到公開套件可能造成現實傷害,最後卻用錯誤線索說服自己仍身處模擬環境。

公開版 Claude 唔可以直接同呢批模型畫等號

今次測試刻意關掉正式產品常用嘅 classifiers 同監察,目的係量度底層模型嘅資安能力;模型本身仍保留各自嘅安全訓練。評估亦喺獨立基礎設施執行,官方指佢哋接觸唔到 Anthropic 敏感內部系統同客戶資料。所以,事件證明高能力 agent 喺權限錯配下可以造成真實損害,但未足以推論公開版 Claude、Claude Code 或其他正常部署產品會照樣行事。

同 OpenAI/Hugging Face 嗰宗事故相比,兩者嘅入口亦有明顯分別。OpenAI 指模型搵到套件 registry 快取代理嘅未知漏洞,再逐步取得上網能力;Claude 今次面對嘅係原本已經開放嘅網絡路徑。共同點係兩邊模型都專注完成指定 benchmark,安全控制又為測試而減少。agent 冇必要產生惡意意圖,只要任務夠進取、工具權限夠大,加上一個錯誤假設,後果已經可以越過實驗室邊界。

高權限 coding agent 要當自動化帳戶管理

公司部署 Claude Code、Codex 或其他可以執行指令嘅 agent,最實際嘅做法係預設封鎖對外連線,只按任務開放指定網域;短期憑證亦要限制資源、操作範圍同有效時間。套件安裝最好經受控 registry、固定版本同完整性核對,發佈新套件、改 CI/CD、讀取正式資料或者連接陌生主機時,就加返人工確認。只靠 prompt 寫明「唔准上網」,防護力同喺門口貼張紙差唔多。

監察亦要跟得上 agent 嘅速度。DNS、網絡連線、套件發佈、憑證使用同 shell 指令都要即時留紀錄同設警報,發現出界就中止整個 session,唔好等任務完成先睇 transcript。Anthropic 已暫停相關資安評估,亦話會加強網絡驗證、持續監察同供應商管控;三間受影響組織仍未具名,第三方覆核同調查亦未完,官方之後可能再更新調查結果。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook