AI agent 越界未必係越獄:Codex、Claude Code 權限應該點設
Tech News

AI agent 越界未必係越獄:Codex、Claude Code 權限應該點設

圖片:via TechNews 科技新報 — https://infosecu.technews.tw/2026/08/21/rogue-ai-agents-arent-evil-theyre-just-eager-to-please/
TechLab 編輯部(譯)·

測試事故揭示目標導向風險,開發團隊要由執行環境收緊權限

AI coding agent 而家識睇成個程式庫、執行指令、裝套件同改檔案,實用程度高咗,出事半徑亦大咗。近期幾宗「越界」事件最值得拆解嘅地方,係 agent 收到目標之後,會不停搵可行路線;如果執行環境剛好畀到網上存取、工具同憑證,佢揀中嘅路未必符合操作者原意。

「太想取悅人」只係一個比喻

TechNews 科技新報報道,UC Berkeley 教授 Dawn Song 接受 Wired 訪問時,用「太想取悅人類」形容近期 agent 嘅表現。呢句幾易明,但唔應該當成模型真係有討好人嘅情緒。較準確嘅講法係:強化學習會獎勵成功完成任務嘅行為,模型能力愈強,愈識拆解多步工作、試唔同方法同調用工具,亦愈有機會搵到設計者冇預計嘅捷徑。

換句話講,訓練畀咗 agent 一個清楚目標,環境又畀到好多手段,但規則未必覆蓋晒所有情況。模型可能搵到較快嘅做法,但未必次次都判斷到點解唔應該咁做。呢種目標導向行為同惡意仍有好大距離,現有資料亦證明唔到模型具備人類式動機,所以標題所講嘅「取悅」最多只適合用嚟解釋現象。

AISI 公開 AI agent cyber 測試事故報告嘅官方封面圖

圖片:UK AI Security Institute

有啲事故,agent 根本冇攻破 sandbox

英國 AI Security Institute(AISI)8 月公開一宗 cyber 測試事故:122 次測試之中,有 10 次出現未經批准嘅公開網上行動,共錄得 19 個相關操作。最嚴重嘅一次涉及向真實開源項目提交惡意程式碼,再嘗試影響維護者接受改動。維護者最終拒絕咗提交,AISI 亦話暫時冇證據顯示造成實際損害。

呢份報告同「AI 衝出牢籠」嘅印象差好遠。AISI 明確話,agent 冇攻破 sandbox,測試本身刻意開放互聯網,模型供應商嘅 cyber 過濾亦關閉咗;部分 task prompt 嘅設定仲有錯,令任務近乎冇可能按原定範圍完成。呢啲條件推高咗越界機會,但 agent 持續搵方法接觸真人同公開系統,仍然係一個要認真處理嘅警號。

Sandbox 有冇用,要睇實際封咗邊啲存取權限。

Sandbox 可以限制 agent 寫邊啲目錄、開咩 process,同埋可唔可以碰到主機其他位置。不過檔案隔離、網上存取同身份憑證係三條唔同嘅閘。就算 agent 留喺 container 入面,只要 container 可以任意連出去,又帶住有效 GitHub token、雲端金鑰或者公司內部 API 權限,佢一樣可以對外改資料同觸發操作。

網上內容亦會帶入 prompt injection 風險。惡意指令可以藏喺 README、issue、套件文件、網頁甚至工具輸出,agent 讀到之後有機會將外來文字當成新指示。單靠一句「忽略可疑內容」守唔住呢類攻擊;模型一旦判斷錯誤,實際損害有幾大,主要睇佢手上有咩工具同權限。

用 Codex、Claude Code,先收緊四樣嘢

第一係 執行範圍:日常工作用 workspace write 或同級 sandbox 已經夠,敏感程式庫可以先用唯讀模式,避免 agent 碰到 SSH 設定、個人檔案同其他項目。第二係 網上存取:預設關閉,真係要裝套件或查文件先開指定 domain;OpenAI 公開嘅內部做法亦係用 allowlist、denylist 同 proxy,冇畀 Codex 任意連去所有網站。

第三係 憑證隔離:畀 agent 用獨立、短期兼細 scope 嘅 token,測試環境亦唔好繼承 production secrets。只讀 GitHub 權限就唔應該順手畀埋合併、發佈同刪除能力。第四係 人工審批:部署、刪資料、改 database schema、提交外部 PR、發訊息同調整權限,都應該停低畀人睇清楚目標、參數同 diff。Claude Code 個跳過權限提示選項,同埋 coding agent 嘅 full-access 模式,只適合放喺額外隔離、冇敏感憑證嘅環境。

監察有助發現異常,但高風險操作仍然要靠權限系統截住。

Song 提到可以用另一套 AI 監察主 agent;OpenAI 亦會保留工具調用、審批同網上存取決策記錄,交畀保安系統分析。呢類監察有助搵異常,不過 AISI 嗰宗事故亦顯示,事後先睇 log 可能已經太遲。高風險操作應該由權限系統直接拒絕或等人批准,唔好交畀模型自行判斷自己有冇越界。

公司一旦畀 coding agent 接觸內部程式碼、MCP 工具或者雲端帳戶,就應該定期檢查可寫目錄、網上 allowlist、token scope 同審批規則。模型能力會繼續變,呢四道閘亦要跟住重新評估。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook