
AI 防線俾簡單授權藉口繞過,coding agent 權限要逐層收緊
Talos 發現低門檻 jailbreak,企業要由執行層補防線
一句「有授權」點解咁有效
TechNews 科技新報報道,Cisco Talos 分析黑客留低嘅 prompt 紀錄、設定檔同工具輸出後,發現有人只要將工作包裝成 CTF、漏洞懸賞或者已獲授權測試,模型就可能繼續協助;亦有人拆散工作,分幾次對話逐件完成。Talos 話呢類繞過見於多個平台,不過研究冇逐項交代邊句指令攻破邊個版本,所以唔可以由 Claude Code、Codex、Cursor 同 Gemini 曾出現喺樣本入面,就推論四款工具可用同一招穩定攻破。

圖片:Cisco Talos
Jailbreak 同軟件漏洞係兩回事
將呢件事叫做生成式 AI「最大漏洞」會令人以為有一個可重複觸發、等緊廠商修補嘅程式錯誤。今次證據主要指向模型判斷意圖時容易接受未經核實嘅背景,而合法紅隊工作同真攻擊本身又會用到相近技術,界線確實難劃。**Jailbreak 係安全政策俾人繞過;傳統漏洞就涉及程式實作缺陷同清楚嘅受影響版本。**兩者可以一齊出現,但風險評估同修補方法完全唔同。
Agent 權限愈大,出事後果愈嚴重
普通 chatbot 答錯一段內容,影響多數停留喺畫面;coding agent 就可以讀 repo、改檔、行 shell 指令、裝套件,甚至接觸 Git、雲端同部署工具。模型通常只靠眼前脈絡判斷用家係咪真係獲授權,冇可靠渠道查證一部 server 屬於邊個。當 README、issue、第三方套件輸出或者持久設定混入惡意指示,模型拒答機制就仲唔適合充當權限系統。保安邊界應該由作業系統、容器、IAM 同 network policy 執行,唔應交俾模型估。
Talos 個案顯示 AI 最擅長加快現成打法
Talos 完整研究提到,一名法語使用者用未公開名稱嘅 AI 工具,將公開 React2Shell 資料同 proof of concept 拼成自動掃描及收集憑證嘅流程。目標清單有 9,180 個 host,研究員喺輸出檔見到來自 54 個目標嘅資料;前者唔代表全部成功入侵。研究亦判斷操作者識營運攻擊流程,但開發水平只屬初階至中階。呢點幾關鍵:現階段 AI 主要係幫操作者加快同擴大現成攻擊流程,但揀目標、驗證結果同處理失敗,仍然要靠有經驗嘅人。
現成產品已有防線,但設定可以令佢失效
官方文件顯示,Codex 預設會限制寫入範圍,network access 同工作區外修改要批准;Claude Code 亦提供檔案、網上連線 sandbox 同敏感操作批准。Cursor CLI 互動模式會先問准先行 terminal command,但非互動模式有完整寫入權限。呢啲差異提醒開發團隊,產品名本身講唔到實際風險,要睇執行模式、agent 身份、掛載咗咩秘密、可連去邊度,同用家有冇為慳時間關掉提示。全權限 agent 如果直接喺開發者主機運行,出事時嘅影響自然大過喺隔離容器做短期工作。
四層防線點樣實際配置
第一層係最小權限:用專用帳戶、短期 token 同細範圍 IAM,唔好將 production 憑證掛入一般工作區。第二層係隔離:陌生 repo 同外來內容放入獨立 VM 或容器,檔案只開必要目錄,對外連線用 allowlist。第三層係人工批准:畫面要清楚顯示完整指令、實際檔案路徑、network 目的地同預期副作用,高風險操作逐次批核。第四層係紀錄:集中保存 prompt、tool call、批准結果、檔案 diff、指令輸出同對外連線,方便事後追查,而且紀錄唔應只留喺 agent 可以修改嘅同一部機。
模型安全限制仍然有用,可以擋住部分隨手濫用,不過公司部署 coding agent 時要當佢係其中一層訊號。開發、IT 同保安團隊下一步應該先盤點 agent 實際攞到嘅帳戶、秘密同 network access,再測試批准流程遇上大量提示時會唔會變成閉眼撳確認。
參考來源
- TechNews 科技新報 — 駭客靠「我有權限」指令就能騙過 AI,Cisco Talos 揭露生成式 AI 最大條漏洞 — original report
- Cisco Talos:黑客點樣將 AI 變成攻擊工具 — Talos 完整一手研究,列出 guardrail 繞過方式、樣本限制同 React2Shell 個案數據。
- Axios:黑客 AI 對話紀錄揭示攻擊手法 — 引述 Talos 研究人員,補充資料來源、模型名稱同個案背景。
- OpenAI:Codex agent 批准同 sandbox 安全設計 — 官方文件,核對 Codex 工作區寫入、network access、批准模式同操作紀錄功能。
- Anthropic:Claude Code 安全設計 — 官方文件,核對 Claude Code 權限、sandbox、人工批准同監察建議。
- Cursor:CLI 使用同指令批准 — 官方文件,核對互動模式指令批准同非互動模式寫入權限。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







