
AI agent 開始長駐背景做嘢,下一步係管權限、成本同審批
由 coding 到客服表格,背景 agent 啱用但唔可以放任
發生咩事
TechCrunch 報道,Claude Code 負責人 Boris Cherny 6 月 19 日喺 Meta @Scale talk 講到 AI loops,話呢步同由人手寫 source code 轉去 agent 寫 code 一樣大。佢講嘅 loop 有別於普通 for loop:一批 agent 長駐背景,有 agent 睇 code architecture,有 agent 搵重複 abstraction,搵到就照平時咁開 pull request。重點係佢哋唔係做完一單 task 就散,因為 code base 日日變,佢哋可以一直跑。

圖片:OpenAI Developers
點解而家先熱
其實 loop 概念好舊,程式一直都有遞迴同條件停止;新嘅位係停止條件由另一個 agent 判斷,結果就冇傳統程式咁 deterministic。Geoffrey Huntley 嗰個 Ralph Loop 玩法,大概係叫模型總結自己做過乜,再判斷目標完成咗未。呢類做法以前容易中途迷路,而家模型長 context、tool use、coding agent 都成熟咗,先有條件變成產品功能。
唔只係工程師玩具
如果淨係睇 Claude Code 或 Codex,loops 似係工程師先會 care。但官方文件已經講到好貼地:OpenAI Codex Cloud 可以喺 cloud environment 背景同時跑多個任務,仲可以開 PR;Anthropic Claude Code routines 支援定時、API 同 GitHub event 觸發,仲有 admin toggle、network allowlist 同 connector 管理。呢啲已經過咗 demo 片入面嘅魔法階段,開始變成公司軟件嘅一層常駐自動化。
公司營運會點用
同一套邏輯搬去日常營運,好易想像:每日巡 Google Sheets 搵漏單、睇客服 inbox 分類投訴、整理 supplier email、更新 Notion 文件、監察 Shopify 商品資料、幫 content team 草擬改稿清單。背景 agent 尤其啱重複、規則清楚、錯咗可以追回嘅雜務;叫佢直接批退款、刪客戶資料或者出街回覆,就係另一回事。
香港中小企最易中招嘅位
以香港中小企嘅工作流做例子,有啲 team 人少,工具又散,可能同時用 Gmail、WhatsApp Business、Airtable、Shopify、Xero、Slack、GitHub,樣樣都想慳人手。背景 agent 對呢種場景好吸引,因為佢唔使等老闆逐條問,夜晚都可以整理返一堆待辦。不過越係咁,權限設計越要細:讀 email 同寫 email 要分開;睇訂單同退錢要分開;開 PR 同 merge 要分開。細公司冇 IT team,反而仲要用最悶嗰套做法,預設只讀、逐步開權限、敏感動作要人手批。
風險唔止係答錯
最麻煩嘅場景係 agent 答錯之後仍然 有權限、有循環、又肯不停試。OWASP 嘅 LLM 風險框架已經點名 prompt injection、sensitive information disclosure、excessive agency、unbounded consumption 呢幾類問題;套到背景 agent,意思好直接:一封帶惡意指令嘅 email 可以誤導 agent,過闊嘅 connector 可以拎走資料,冇 token budget 就可以一路燒錢,失敗重試仲可以變成錯誤循環。
成本其實係產品設計問題
TechCrunch 將 loop 放喺 test-time compute 脈絡睇:模型做唔掂就再諗、再試、再叫工具,直到系統判斷可以停。呢招對改 code 好合理,因為測試、lint、PR review 都可以做閘口;但搬去營運 automation,成本同終止條件就要寫清楚。每個 agent 要有時間上限、token 上限、重試上限、每日摘要同停止按鈕,唔係嘅話,「幫我監住 inbox」好快變成「每晚燒一堆 token,第二朝都唔知佢做咗咩」。
最後最實際係審批同權限點設計
所以我唔會叫中小企一見到 background agent 就全部開晒。第一批啱試嘅任務,應該係 低風險、可回滾、有人覆核:例如整理 email label、出客服草稿、開 GitHub issue、草擬 PR、更新內部知識庫 draft。去到會寫客戶、會郁錢、會改 production、會接觸個人資料嗰啲,就要先有 audit log、approval queue、權限分層同成本 alert。真正要比較嘅,係邊套工具有足夠 audit log、approval queue、權限分層同成本提示,畀公司放心長駐背景跑。
參考來源
- TechCrunch — The AI world is getting ‘loopy’ — original report
- Fireside Chat with Boris Cherny, Head of Claude Code — 核對 @Scale talk 嘅題目同 TechCrunch 引用嘅場景。
- Codex web - OpenAI Developers — 核對 Codex Cloud 可以喺背景同 parallel 跑任務、連 GitHub 開 PR 嘅官方講法。
- Automate work with routines - Claude Code Docs — 核對 Claude Code routines 支援定時、API、GitHub event,同 admin、network、connector 控制。
- OWASP Top 10 for Large Language Model Applications — 核對 prompt injection、資料外洩、權限過大同成本無上限等 agent 風險。
- everything is a ralph loop — 補充 Ralph Loop 呢個 agent loop 玩法點樣由工程師社群傳開。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







