AI coding agent 叫你撳批准:40 萬次判斷揭開審批疲勞盲點
Tech News

AI coding agent 叫你撳批准:40 萬次判斷揭開審批疲勞盲點

圖片:via TechNews 科技新報 — https://infosecu.technews.tw/2026/08/11/developers-miss-one-third-dangerous-ai-coding-instructions/
TechLab 編輯部(譯)·

審批畫面欠上下文,sandbox 同最少權限可以縮細出事範圍

40 萬次判斷講咗啲咩

TechNews 科技新報報道,比利時軟件開發者 Alex Wauters 整咗一款瀏覽器遊戲,玩家要喺 60 秒內替模擬 AI coding agent 批准或拒絕指令。Wauters 公布嘅紀錄涵蓋逾 40,000 局、約 409,000 次決定,玩家平均漏過約三分一威脅;另有 7% 玩家由頭到尾全部批准。審批掣擺咗喺度,唔代表每次撳掣都經過完整安全判斷。

AI agent 權限遊戲整體統計,包括平均漏判率同玩家表現

圖片:Scale X/Alex Wauters

數字夠搶眼,但唔係開發者普查

呢批數據來自自選參加嘅遊戲玩家,網站亦冇要求參加者證明自己係專業開發者。每局只有一分鐘,大約 34% 畫面都係威脅,密度高過日常工作好多;統計亦由遊戲開發者自行收集同分析,暫時未見同行評審或者獨立團隊重做。**三分一只適合形容呢場遊戲,唔應該直接套落所有開發者身上。**不過限時、重複提示同急住完成工作,的確同真實開發環境有幾分相似。

圖表顯示玩家喺限時遊戲後段漏過威脅嘅比例上升

圖片:Scale X/Alex Wauters

npm run analyze 點解咁易過關

最值得拆嘅數字係 npm run analyze 有 64.7% 放行率。指令個名好正常,但 npm run 實際會執行 package.json 入面對應嘅 script;agent 可以先修改呢個檔案,再用一個熟口熟面嘅名稱包住任意 shell 指令。遊戲已經喺上方紀錄顯示可疑內容,仍然有近三分二玩家批准。人通常只會望今次要跑咩指令,未必記得翻查 agent 之前改過邊啲檔案,所以好易睇漏呢條執行鏈。

同樣情況唔限於 npm。測試程式可以載入 agent 剛寫落去嘅惡意模組,build script 可以呼叫另一個檔案,安裝套件亦可能觸發 lifecycle script。只覆核畫面上嗰行 command,睇唔到成條執行鏈。至於讀取憑證,玩家會對 SSH private key 警覺,換成 AWS credentials、Kubernetes 設定或者 shell profile,風險就冇咁一眼睇得出;尤其 .zshrc 有冇 API key,仲要視乎每部機點設定。

太緊又會變成人肉樽頸

全部拒絕同樣唔實際。Wauters 嘅數據顯示,設定公司內部 npm registry 呢類正常操作有 59% 遭阻擋,清理 dist/ 亦有 45% 遭拒絕。安全同工作速度長期互相拉扯,最後好容易變成見到提示就慣性批准。Anthropic 早前公布內部遙測,使用者批准約 93% 權限要求;公司亦話啟用 filesystem 同網絡隔離後,內部使用嘅提示數量減少 84%。兩組數據唔屬於同一項研究,唔可以互相驗證,但都指向同一個產品設計問題:太多低價值提示會用盡人嘅注意力。

開發團隊可以點樣收窄權限

第一步係先畫細 agent 嘅活動範圍。Codex 官方文件寫明,本機預設唔畀 agent 上網,作業系統層嘅 sandbox 亦只准佢喺工作目錄寫入檔案。;Claude Code 亦提供 filesystem 同網絡隔離。實際設定可以再保守啲:用獨立 worktree、devcontainer 或即棄 VM,預設只開 repo,網絡改用 domain allowlist,環境內只放短效兼低權限憑證。production 資料庫、雲端管理員 key、SSH key 同簽署憑證唔好交俾日常 coding agent。

第二步係將執行內容同之前嘅修改一齊覆核。agent 要跑 npm run、測試、build 或部署指令之前,先睇 git diffpackage.json、lockfile 同新增 script;安裝依賴時亦要檢查來源、相似拼字同 lifecycle script。高風險 repo 可以先用 read-only 或 plan mode 睇清楚會改啲咩,再喺乾淨環境執行。測試通過只代表程式做到預期結果,唔代表中途冇讀走憑證或者向外傳資料。

第三步係用硬性規則擋住清楚唔應該發生嘅動作,例如禁止讀取家目錄憑證、限制 workspace 以外寫入、預設封鎖未知網域,同拒絕直接接觸 production。人手批准留俾權限擴張、刪除資料、對外傳送、部署、付款同改 access control 呢類影響大或者難回復嘅操作。合併前再由另一個人睇 diff、依賴變動同執行紀錄,會實用過要求同一位開發者全日逐行判斷每個 shell prompt。

人手覆核仲有價值,不過審批者要有足夠上下文,系統亦要預先限制最壞情況。用開 Codex、Claude Code 或同類工具嘅團隊,而家值得先檢查 agent 到底讀到邊度、出唔出到網,同手上攞住咩憑證。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook