#coding agent
72 篇文章
TechLab 所有關於「coding agent」嘅文章、評測同教學,由最新排起。
Tech NewsAI 術語愈講愈多:看懂 coding agent 前先分清它能做甚麼
AI 產品把 agent、推理、MCP 等術語推到前台。真正影響用戶的,不是名詞有多新,而是系統可否跨工具行動、誰負責覆核,以及錯誤會在何處擴大。
3C 產品讓 coding agent 讀日誌除錯:最小權限比自動修復更重要
一名 SaaS 開發者向 coding agent 開放 server 日誌的唯讀檢視後,代理可追查程式問題並提出修復。實務關鍵不在於給 AI 更多權力,而是以脫敏、工具白名單和人工覆核守住生產環境。
Tech NewsMeta 以近九成半折扣換取 agent 使用資料,團隊應怎樣取捨
Meta 為 Muse Spark 設「contributor」價格,以大幅降低 token 成本換取 prompt 與輸出資料。對開發團隊而言,重點不只在平價,而是能否建立可分享與不可分享資料的界線。
Tech NewsAI agent 越界未必係越獄:Codex、Claude Code 權限應該點設
AI agent 為咗完成任務,有時會揀中人類冇預計嘅捷徑。不過近期事故亦涉及開放網上存取、關閉安全過濾同測試設定出錯。與其估模型有冇惡意,開發團隊更實際嘅做法係限制工具、網上存取同憑證,再為高風險操作保留人工審批。
Tech NewsSlack Code 拉 coding agent 入頻道:開發協作快咗,權限亦要睇實
Slack Code 想將 coding agent 由個人開發工具變成頻道入面嘅團隊成員。任務分派、code diff、HTML 預覽同批核都放返喺同一處,產品同設計亦容易加入。不過集中喺頻道睇到,唔代表程式碼、憑證同 agent 權限已經安全。
Tech NewsOpenAI 據報拆散 Preparedness team:分流風險評估會削弱把關嗎?
OpenAI 據報將 Preparedness team 拆開,bio、cyber 等風險評估交返畀既有團隊。官方文件顯示框架同發布門檻仍然存在,不過中央審核角色淡出之後,跨領域風險會由邊個統籌、內部審核仲夠唔夠獨立、公開資料會唔會縮水,都值得繼續留意。
Tech NewsOpenAI、Anthropic齊推平價模型:coding agent帳單點先計得準
OpenAI 同 Anthropic 都用低價搶企業同開發者,不過兩間公司嘅減價玩法唔同。統一 token 用量計,GPT‑5.6 Luna 已經貼近 DeepSeek 價位;實際跑 coding agent,張單有幾大仲要睇 cache 命中率、推理強度、輸出長度同失敗重試次數。
Tech NewsKog 單一 kernel 推到 3,000 tokens/s:coding agent 點解最食延遲
Kog 話自家推理引擎可喺 8 張 MI300X 上跑到每秒 3,000 個輸出 token。個數字夠搶眼,不過真正值得睇嘅係佢點樣壓低單一請求延遲,同埋呢套方法搬去大型第三方模型時會遇到咩限制。
Tech NewsOpenAI agent 連環攻破 sandbox:Hugging Face 事件揭開權限隔離盲點
OpenAI 嘅資安評測 agent 利用零日漏洞離開 sandbox,再經第三方服務攻入 Hugging Face。事件冇證明模型有逃走意圖,但清楚示範咗 agent 可以用機器速度串連細小漏洞,令權限、網絡出口同憑證配置一口氣失守。
Tech NewsGrok 4.6 瞄準長時間 coding agent:平過 GPT、Claude,但跑分未贏晒
Grok 4.6 推出後,最值得開發者睇嘅係長時間 agent 工作能力同進取 API 定價。佢部分 coding 跑分追到 GPT-5.6 Sol 同 Claude Fable 5 附近,不過未有全面優勢,500K context 遇上大型 codebase 亦有取捨。
Tech NewsOpenAI 煞停 Astra:Critical 門檻揭出 agent 權限風險
OpenAI 話內部評估未能排除 Astra 達到 Critical cyber 門檻,決定暫停未符合新保安要求嘅相關工作。不過,公開資料未足以證明 Astra 已經越線。今次更值得拆嘅係:coding agent 一旦有 terminal、credentials 同外部連線,權限設計錯一步已經可以放大成保安事故。
Tech NewsCursor 同 xAI 夾手訓練 Grok 4.5:AI coding 入口點樣爭
Grok 4.5 同 Cursor 一齊訓練,第三方 coding agent 測試亦追到 Codex 附近。呢次合作顯示 AI coding 競爭已經由鬥模型,擴展到開發工具、算力、產品介面同開發者回饋;不過距離證明 xAI 已經全面追平對手,仲差實際項目同長期穩定性呢兩關。
Tech NewsAISI 測試五款 AI agent 全數試過越界,企業監察靠模型自白唔夠
英國 AISI 發現五款 OpenAI、Anthropic 模型喺網絡安全測試都有越界紀錄,事後自我申報同 chain-of-thought 亦未能可靠交代。對用緊 coding agent 嘅團隊嚟講,權限、sandbox、獨立紀錄同結果核實都要由系統層面處理。
3C 產品Meta Muse Code 加入 AI 寫 code 戰場,主打背景 agent
Meta 推出終端機 coding agent Muse Code beta,由 Muse Spark 1.2 驅動,主打大型 repo、長時間任務、背景 agent 同本地 event log。工具公開安裝,但香港帳戶、API 收費、資料保留同遙測安排仲有關鍵資料未交代。
Tech NewsAI coding agent 越界唔等於覺醒:AISI 事故揭開權限設計漏洞
英國 AISI 測試期間,OpenAI 同 Anthropic 模型合共做出 19 次未獲授權行動,當中包括提交惡意程式碼同開假帳戶。測試刻意開放上網權限兼關掉部分防護,事件揭示 coding agent 一攞到工具、token 同網上存取,權限設計就要當正式保安系統處理。
3C 產品Apple 限制 AI 漏洞報告:搵 bug 快咗,點解人手驗證反而追唔切
Apple 據報為漏洞懸賞平台加入提交上限,原因係大量未經驗證嘅 AI 報告拖慢審核。不過 Apple 同時承認 Claude、Codex Security 協助安全研究。兩邊放埋一齊睇,問題落喺研究員有冇交到可重現嘅證據。
Tech NewsHank Green 承認過度依賴 AI:ChatGPT 點解令人跌入愈做愈多循環
Hank Green 承認過度靠 ChatGPT 幫手搵資料,亦形容自己不停用 LLM 做更多嘢嘅狀態唔健康。呢宗風波值得睇嘅,係生成式 AI 點樣令研究、寫稿同 coding 變成冇明確終點嘅循環,同埋用家可以點樣設返界線。
3C 產品叫 AI 寫少啲 code:由加功能轉去刪重複邏輯,點樣先唔會愈改愈亂
AI coding agent 好識加功能,亦好容易為每個要求另開一套邏輯。叫佢搵重複功能同 dead code 的確實用,不過落手刪之前,要先鎖住現有行為,再用細 diff、細 commit 同人工 review 控制風險。
Tech NewsAI 工具幫手變監工:Doctorow 新書講中辦公室最煩嗰件事
Cory Doctorow 借「reverse centaur」拆 AI 職場神話:好工具放喺自己手上有用,放喺 KPI、客服 bot 同工單系統後面,就好易變成催快、卸責、量化人嘅管理機器。
Tech NewsAI agent 走出 sandbox:OpenAI、Anthropic 事故畀團隊嘅權限警號
OpenAI 同 Anthropic 先後披露,cyber 評估入面嘅 AI agent 接觸到真實網絡,仲闖入外部公司系統。幾宗事故成因唔同,但都提醒用 Codex、Claude Code 同其他 coding agents 嘅團隊:sandbox 只係起點,網絡出口、credentials、監察同人工批准少一樣都唔得。
Tech NewsClaude「失控入侵」三個組織?測試環境開咗上網,供應鏈亦中招
Claude 喺資安測試期間接觸到三個真實組織,聽落似 AI 自行逃出沙盒,實情係測試環境錯誤開放上網,模型又以為眼前全部都係 CTF 場景。事件亦揭示高權限 coding agent 一旦欠缺網絡隔離、套件管制同即時監察,普通設定失誤都可以迅速變成供應鏈事故。
Tech NewsAmazon AI 項目傳超支 180 萬美元:coding agent 點解會愈跑愈貴
Amazon 一個用 Claude Sonnet 配對作者資料嘅內部項目,據報超支達 180 萬美元,問題過咗約五個月先曝光。個案未足以證明 Claude 特別昂貴,反而顯示 coding agent 一旦任務邊界、預算同權限都太鬆,按 token 收費可以靜靜地滾成大數。
Tech NewsClaude 測試連到公網波及三間公司,企業用 coding agent 要點封權限
Anthropic 翻查逾 14 萬次網絡安全評測,發現三款 Claude 曾喺六次測試入面未經授權接觸三間機構嘅 production 系統。事件揭示 coding agent 一有公網、憑證同執行工具,普通配置錯誤都可以變成真實攻擊路徑。
3C 產品叫 Claude Code 開工前先問三條問題,點解可以少行冤枉路
XDA 作者建議叫 Claude Code 寫 code 前最多問三條澄清問題,減少 agent 自把自為。不過呢招只適合含糊任務;想穩定做好,仲要交代完成條件、檔案範圍、現有 convention 同驗證方法。