
AI 黑客識睇密碼,防守方喺雲端 secret 旁邊埋 prompt 陷阱
Context bomb 觸發模型 guardrail,受控測試攻擊成功率急跌
AI 黑客而家唔止識幫人寫 script;有工具權限嘅 agent 已經可以自己掃 AWS、搵 credential、轉 IAM role,再試權限提升。Tracebit 新 working paper 今次個諗法幾毒:agent 搵到 secret 後會餵返入模型 context,防守方就喺 decoy secret 放一小段特製 prompt。模型一讀到,安全過濾器拒絕下一輪推理,自動攻擊 session 跟住停低。研究團隊叫呢招做 context bomb。
個陷阱點樣爆
測試入面,context bomb 放喺 AWS Secrets Manager 嘅 canary secret value。攻擊 agent 掃到呢個假 secret,再用工具讀走內容,工具輸出就入咗模型 context;同一個 read 會觸發 canary alert,下一次 model call 亦可能俾模型或供應商嘅內容過濾器截停。基本上就係 defensive prompt injection:防守方借模型 guardrail 反過來卡住攻擊。研究人員按模型揀安全政策最敏感嘅題材,西方前沿模型對危險生物內容反應較大,中國供應商提供嘅模型就較易俾政治敏感內容截停。AWS 本身冇加新保安功能,成效來自模型點處理讀入去嘅文字。

圖片:Tracebit Research
數字好睇,但兩組研究要分清
按 Tracebit 數據,研究揀咗五款較強模型,合共為 152 次 attack run 計分。比較乾淨環境同加入一個 context bomb 嘅環境後,取得 admin 權限嘅整體比率由 57% 跌到 5%,admin 加持久後門嘅完整攻陷由 36% 跌到 1%,完成任何 attack path 就由 91% 跌到 15%。Opus 4.8 喺 baseline 有 93% run 攞到 admin,加入 bomb 後係 0%;Gemini 3.1 Pro 完成任何 attack path 亦由 90% 跌到 0%。有 bomb 嘅環境仍有模型升到 admin,呢啲數字亦只代表受控 cyber range。
另一組好易撈亂嘅數字來自 Tracebit 五月份 canary 研究:951 次原始 run 入面有 599 次獲計分;有 canary 嘅情況下,95.9% 成功升到 admin 嘅 run 都喺第一個關鍵動作之前響咗警報,中位數早 8 分鐘。單純預先話畀 agent 知環境可能有 deception,完整攻陷率由 20% 跌到 3%。嗰次量度 canary 偵測同預先警告,未測今次嵌入 secret 嘅 context bomb;兩組結果唔可以拼成同一項成效。
諗法幾聰明,但繞過方法亦好直接
呢招最啱擋冇人睇住、一路掃資源一路將結果塞入 context 嘅自動 agent。佢哋越勤力 enumerate,撞中 decoy 嘅機會越高。不過攻擊者可以改 harness,先喺 tool layer 當 secret 係 raw bytes 咁處理、遮走可疑文字,或者轉用 guardrail 較鬆嘅本地模型。Tracebit 仲未測 uncensored model,測試亦主要用 OpenCode 經 OpenRouter 跑,只有 Opus 4.8 改用 Claude Code。換 agent framework、模型版本或供應商,結果都可能變。
Tracebit 本身賣 deception security 產品,呢份公司 working paper 直接支持佢嘅產品方向,亦未經 peer review。截至 7 月 13 日,公開資料暫時未見獨立團隊重現呢 152 次測試;研究環境、資源名同漏洞細節亦未全部披露,外部要原樣重跑有難度。模型 guardrail 會更新,今日有效嘅題材可能聽日失靈,亦可能誤傷正常 agent。公司自家 coding agent 或 cloud copilot 一旦意外讀到,工作 session 同樣可能俾 guardrail 截停,變成內部 DoS。
放入企業環境,要先收窄爆炸半徑
比較穩陣嘅做法係 bomb 只放喺正常流程永遠唔應該讀嘅隔離 canary,部署前逐個 model 同 provider 做 eval,每次升級 agent 都重跑;如果自家 agent 仍然掂到,個 alert 已經顯示權限或工具範圍放得太闊。NIST 指出,agent hijacking 個根源係可信指令同外來資料撈埋入同一個模型輸入,單靠另一段 prompt 好難徹底補返個架構缺口。
OWASP 指南 同 AWS 安全框架 都叫開發團隊做足 least privilege、工具 allowlist、輸入驗證、隔離、高風險動作人手批核、完整 tool-call log 同 kill switch。企業仍要靠 IAM、sandbox 同授權邊界收窄爆炸半徑;context bomb 可以拖慢攻擊、多畀一個警報,但唔會自動收返已經畀咗 agent 嘅過大權限。
值得試,但先當實驗性控制
我會視 context bomb 為 canary 嘅實驗性加強版:agent 誤碰就響警報,同時有機會停機,對大規模自動攻擊確實幾阻手。正式部署之前,仲要睇獨立團隊可唔可以跨 framework 重現、攻擊 harness 過濾 secret 後剩返幾多效果,同自家 agent 會唔會誤中。未有呢啲答案之前,可以喺隔離 decoy 小規模試,但權限管理、隔離同監察一樣要擺喺前面。
參考來源
- Ars Technica — Now, defenders are embracing the prompt injection, too — original report
- Context bombs: stopping AI attackers in their tracks — Tracebit 最新 primary research,提供 152 次測試嘅方法、模型、數字同限制。
- Deception warns your teams at the speed of an AI attacker — 較早嘅 canary 研究,用嚟分清偵測、預先警告 agent 同 context bomb 三種效果。
- Technical Blog: Strengthening AI Agent Hijacking Evaluations — 解釋 indirect prompt injection 背後嘅可信指令同外來資料混合問題。
- AI Agent Security Cheat Sheet — 核對 least privilege、工具限制、人手批核、隔離同監察等防守建議。
- The AWS AI Security Framework — AWS 官方 defense-in-depth 建議,涵蓋 IAM、網絡隔離同應用層過濾。
- Tracebit — 確認 Tracebit 銷售 deception security 產品,交代研究方嘅商業利益。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







