
Local AI agent 接管日常自動化前,先問清楚點解唔用 script
檔案搬移、備份同清 cache,固定規則通常可靠得多
XDA 作者 Anurag Singh 原本用五個 Python script 處理相片備份、整理 Downloads、重新命名檔案、清理 app cache,同埋監察硬碟用量。佢改用一個 local AI agent 接手,原意係叫 agent 自己睇環境再決定點做,結果遇到揀錯目錄、跳過驗證,同埋工作未完成已經報成功。聽落幾嚇人,不過要先講清楚:呢個係一位作者嘅個人案例,唔足以代表所有 local agent。
規則寫得清楚,agent 只係加多咗變數
將 PDF 搬去 Documents、圖片搬去 Pictures,本身已經可以寫成幾條固定規則。Script 每次都行同一條路徑,遇到未知副檔名就停手;agent 就要先理解檔案、揀工具、組合指令、執行,再判斷結果。模型每多判斷一步,都多一個出錯位,亦冇令呢類簡單工作做得更好。如果輸入、目的地同例外情況全部列得清,確定性通常值錢過靈活性。
原文亦提到 script 可以明確禁止覆寫、拒絕 symbolic link,同埋目的地失效時即刻停低。呢啲保護寫入程式後,每次執行都會照辦;agent 收到同一批要求,仍然要逐次理解。Prompt 寫得再仔細,都唔等於檔案系統真正執行咗權限限制。Docker Agent 嘅 filesystem 工具就會先解析 symlink,再檢查路徑有冇走出白名單,呢類限制要由工具層硬性守住先穩陣。
Local 保住資料,冇自動保證安全
Local model 嘅實際好處係檔案內容可以留喺自己部 Mac、PC 或 NAS,唔使為咗分類文件先送去雲端。不過,模型喺本機行,唔代表佢攞到嘅權限一定安全。 Agent 如果睇到成個 home directory、可以開 terminal,甚至可以連網,錯誤指令照樣可能刪檔、覆寫備份,或者將敏感內容送出去;Downloads 入面嘅惡意文件亦可能夾帶 prompt injection,誘導 agent 做額外操作。
安全設定應該由最小權限開始:只開放指定目錄,讀取同寫入權限分開,憑證、SSH key 同備份庫全部排除。路徑要用白名單,操作前解析 symlink,搬檔預設禁止覆寫。第一次執行先做 dry run,列出來源、目的地同預計改動;真正刪除、清 cache、批量改名或覆蓋檔案,就要有人確認。每次工具呼叫、錯誤同最後結果亦要留完整 log,方便追查 agent 究竟做過咩。
備份同清理工作,失敗回報要由結果話事
「指令冇報錯」同「工作完成」差好遠。備份要核對目的地存在、檔案數量、大小或 checksum;搬檔要確認新檔寫好先處理原檔;清 cache 就要清楚限制可刪目錄,遇到權限錯誤即刻停。呢啲條件用 validator 或 script 驗證會直接好多。高風險操作前亦要有另一份可還原備份,否則 agent 口頭講成功,資料可能已經少咗一截。
資源消耗亦係現實問題。普通 script 可以直接執行檔案檢查;local agent 就要先載入模型、整理 context,再跑多輪工具呼叫。原文冇交代模型、agent framework、prompt、硬件同權限設定,亦冇提供可重現測試,所以唔適合由呢次經驗推算實際耗電或失敗率。不過用模型處理一條固定搬檔規則,成本明顯多過直接執行程式。
Agent 適合處理模糊位,script 負責最後落手
較實用嘅組合係畀 agent 做分類同處理例外,再交結構化結果畀 validator。譬如 agent 可以判斷電郵附件係咪發票,輸出文件類型、日期同建議檔名;validator 檢查副檔名、路徑、大小同命名格式,最後由 script 計 checksum、禁止覆寫,再存入指定目錄。Agent 嘅語意理解用喺佢擅長嘅位置,到真正改動檔案時,就交返畀固定、可測試、每次結果一致嘅流程。
AutomationBench 論文亦提供咗一個尺度:研究團隊用跨 app、要遵守政策嘅商業任務測試 agent,發表時最佳前沿模型整體得分仍低過 10%。呢個 benchmark 測 REST API 工作,唔係本機搬檔,唔可以直接套用成 local agent 失敗率;佢只係反映,多步驟自動化一遇到真實規則同例外情況,暫時仲未可靠到可以完全放手畀 agent 做。固定、重複、出錯會傷資料嘅工作,繼續用 script;碰到難以預先列晒規則嘅輸入,先畀 agent 參與,會係而家較穩陣嘅分工。
參考來源
- XDA Developers — I replaced five automation scripts with one local AI agent, and it broke things I didn't expect — original report
- AutomationBench — benchmark 一手論文,用嚟核對測試範圍、方法同發表時嘅整體結果。
- Filesystem Tool – Docker Agent Docs — 官方文件說明目錄白名單、symlink 解析、路徑限制同結構化錯誤處理。
- Securely deploying AI agents – Claude Code Docs — 官方安全指引,補充最小權限、filesystem sandbox 同隔離敏感檔案嘅做法。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







