
AI 術語愈講愈多:看懂 coding agent 前先分清它能做甚麼
AI 產品會議、融資簡報與新功能發布,近年充斥 LLM、RAG、RLHF、agent 等縮寫;TechCrunch 最新整理更把「opaque recurrence」列為新近引起安全研究者討論的用語。問題在於,這些名詞常把能力、底層技術與市場承諾混在一起。對採用 AI 的公司、開發者及一般用戶而言,最需要先辨清的限制是:系統能產生看似流暢的答案,不等於它能可靠地完成工作,更不代表可以毋須人手授權與覆核。
尤其是 coding agent 的出現,令這個分別變得實際。傳統編程助手主要提出程式碼,開發者自行判斷、貼上及執行;coding agent 則被描述為可在 codebase 內反覆寫碼、測試、除錯,甚至提交修正的專門 agent。它的價值在於接手大量試錯與重複工序,但權限一旦延伸至測試環境、資料庫或第三方工具,錯誤的影響範圍亦會隨之擴大。把它理解成「自動完成」顯然太簡化,較貼切的說法是:它會按任務要求,配合可用工具和獲授權的範圍自行執行工作。
Agent 的關鍵在於行動鏈,而非聊天介面
大型語言模型(LLM)是現時多數 AI 助手的語言核心。它從大量文字中的模式學習,收到 prompt 後生成最可能接續的內容;這解釋了它為何能寫摘要、回答問題或草擬程式碼,但也說明輸出本質上仍可能出錯。模型運行並作出預測的過程稱為 inference;在此之前,模型須經過 training,從資料中學習模式。兩者分開看,有助理解為何同一模型在不同硬件、不同雲端配置下,回應速度與成本可以不同。
AI agent 則是在 LLM 之上加入工作流程的概念:它可為一個目標分拆步驟,按需要調用多個 AI 系統或工具,處理例如報銷、訂票、預約等多步任務。這個定義仍相當寬鬆,報道亦指出相關基礎設施尚在建立,不同人對 agent 的理解未必一致。因此,評估一個產品時,與其只問「是否 agent」,不如追問它可以讀取甚麼資料、可操作哪些系統、何時需要確認,以及失敗後會否自行重試。這些問題才會界定它實際可做與不應做的事。
API endpoint 可視為軟件留給其他程式使用的操作入口,讓一個 app 取得另一個系統的資料,或發出指定指令。agent 若可使用這些入口,便毋須模擬人手逐頁按掣,因而有機會完成跨平台工作;但自動化也由此從「建議」跨到「執行」。自動化由「建議」走到「執行」後,便利與風險都會增加;授權設計、操作紀錄和人工覆核,也會比聊天回覆是否自然更重要。對部署者來說,先以有限權限及明確範圍試行,屬於由上述能力所作的合理風險管理推論。
為何 coding agent 仍需要工程師把關
coding agent 專注於軟件開發,可處理寫碼、跑測試和除錯等循環工作,並可跨越整個 codebase 尋找問題。這類工具最適合減少開發者被零碎修正工作切開注意力的情況;不過,報道的比喻也點出限制:它像一名速度極高、永不疲倦的實習生,人類仍要審閱成果。測試通過只代表它符合已有測試所覆蓋的條件,未必等於改動符合產品意圖、保安要求或真實使用情境。
所謂 chain of thought,指模型把較複雜的問題拆成中間步驟處理,以提高邏輯或編程任務的最終答案質素;代價通常是回應需時較長。報道指出,推理模型可由傳統 LLM 發展而來,並透過 reinforcement learning 針對這類逐步思考作優化。對使用者而言,這不應被簡化為「會展示更多推理便一定較準」:中間步驟是處理方式的一部分,仍須以實際結果、測試及可驗證資料評估。
另一個核心風險是 hallucination,即模型生成不正確資訊。當錯誤只停留在聊天視窗,後果可能是誤導;若錯誤答案被 agent 轉換成改碼、下單、預約或資料操作,後果就可能累積。報道把幻覺與訓練資料的知識缺口聯繫起來,亦提到較專門、面向特定領域的模型可望縮小缺口和失實資訊風險。這是降低風險的方向,並非保證:專門化不能取代資料來源核實、權限控制與人手審批。
MCP、快取與模型架構改變的是使用條件
Model Context Protocol(MCP)是一套開放標準,讓 AI 模型毋須為每個配對逐一製作自訂連接器,也可連接外部工具與資料,例如檔案、資料庫、Slack 或 Google Drive。報道以 USB-C 作比喻,說明其目的在於統一連接方式;並指這套標準由 Anthropic 在 2024 年提出,後交予 Linux Foundation,OpenAI、Google 和 Microsoft 其後採用。對開發團隊來說,標準化可減少整合門檻;對管理者來說,亦意味同一類連接能力可能更快擴散,存取範圍與憑證管理要同步跟上。
不少術語則關乎效率而非表面功能。compute 泛指訓練和部署 AI 所需的運算能力及相關硬件,包括 GPU、CPU、TPU 等;大型模型在手機、手提電腦與高階雲端硬件上的推論表現不會一樣。memory cache 則是儲存部分已完成計算、減少重複運算的做法;報道提及 transformer 模型常見的 KV cache,可縮短生成答案所需時間。這些概念提醒採購者:回應速度、可同時服務的人數及運行成本,並不單由模型名稱決定。
模型本身亦有不同取捨。fine-tuning 是用較專門的新資料,進一步訓練既有模型以適應特定任務或領域;distillation 則讓較小的「學生」模型近似較大「教師」模型的行為,目標是以較有效率的模型保留部分能力。Mixture of Experts(MoE)則把神經網絡分成多個專門子網絡,每次請求只啟動其中部分「專家」。它們都可影響成本、速度或特定任務表現,但單憑架構名稱,無法推斷某產品必然更準確、更安全或更適合某個團隊。
接下來值得觀察的,是 AI 產品會否把能力描述轉化成清楚的操作邊界:哪些資料會被讀取、哪些動作可自動執行、哪些環節必須由人批准,以及出錯後如何追查。對開發者,coding agent 的重點將是能否融入既有測試與審查流程;對一般用戶,理解 agent、MCP 和 hallucination 的基本分野,至少可以在面對花巧術語時,知道應該問甚麼,唔好只看示範片段便假定它已可放心代勞。
延伸閱讀
AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。
參考來源
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







