TAG

#coding agent

72 篇文章

TechLab 所有關於「coding agent」嘅文章、評測同教學,由最新排起。

AI 術語愈講愈多:看懂 coding agent 前先分清它能做甚麼Tech News

AI 術語愈講愈多:看懂 coding agent 前先分清它能做甚麼

AI 產品把 agent、推理、MCP 等術語推到前台。真正影響用戶的,不是名詞有多新,而是系統可否跨工具行動、誰負責覆核,以及錯誤會在何處擴大。

4 天前
讓 coding agent 讀日誌除錯:最小權限比自動修復更重要3C 產品

讓 coding agent 讀日誌除錯:最小權限比自動修復更重要

一名 SaaS 開發者向 coding agent 開放 server 日誌的唯讀檢視後,代理可追查程式問題並提出修復。實務關鍵不在於給 AI 更多權力,而是以脫敏、工具白名單和人工覆核守住生產環境。

7 天前
Meta 以近九成半折扣換取 agent 使用資料,團隊應怎樣取捨Tech News

Meta 以近九成半折扣換取 agent 使用資料,團隊應怎樣取捨

Meta 為 Muse Spark 設「contributor」價格,以大幅降低 token 成本換取 prompt 與輸出資料。對開發團隊而言,重點不只在平價,而是能否建立可分享與不可分享資料的界線。

8 天前
AI agent 越界未必係越獄:Codex、Claude Code 權限應該點設Tech News

AI agent 越界未必係越獄:Codex、Claude Code 權限應該點設

AI agent 為咗完成任務,有時會揀中人類冇預計嘅捷徑。不過近期事故亦涉及開放網上存取、關閉安全過濾同測試設定出錯。與其估模型有冇惡意,開發團隊更實際嘅做法係限制工具、網上存取同憑證,再為高風險操作保留人工審批。

22 天前
Slack Code 拉 coding agent 入頻道:開發協作快咗,權限亦要睇實Tech News

Slack Code 拉 coding agent 入頻道:開發協作快咗,權限亦要睇實

Slack Code 想將 coding agent 由個人開發工具變成頻道入面嘅團隊成員。任務分派、code diff、HTML 預覽同批核都放返喺同一處,產品同設計亦容易加入。不過集中喺頻道睇到,唔代表程式碼、憑證同 agent 權限已經安全。

22 天前
OpenAI 據報拆散 Preparedness team:分流風險評估會削弱把關嗎?Tech News

OpenAI 據報拆散 Preparedness team:分流風險評估會削弱把關嗎?

OpenAI 據報將 Preparedness team 拆開,bio、cyber 等風險評估交返畀既有團隊。官方文件顯示框架同發布門檻仍然存在,不過中央審核角色淡出之後,跨領域風險會由邊個統籌、內部審核仲夠唔夠獨立、公開資料會唔會縮水,都值得繼續留意。

26 天前
OpenAI、Anthropic齊推平價模型:coding agent帳單點先計得準Tech News

OpenAI、Anthropic齊推平價模型:coding agent帳單點先計得準

OpenAI 同 Anthropic 都用低價搶企業同開發者,不過兩間公司嘅減價玩法唔同。統一 token 用量計,GPT‑5.6 Luna 已經貼近 DeepSeek 價位;實際跑 coding agent,張單有幾大仲要睇 cache 命中率、推理強度、輸出長度同失敗重試次數。

27 天前
Kog 單一 kernel 推到 3,000 tokens/s:coding agent 點解最食延遲Tech News

Kog 單一 kernel 推到 3,000 tokens/s:coding agent 點解最食延遲

Kog 話自家推理引擎可喺 8 張 MI300X 上跑到每秒 3,000 個輸出 token。個數字夠搶眼,不過真正值得睇嘅係佢點樣壓低單一請求延遲,同埋呢套方法搬去大型第三方模型時會遇到咩限制。

28 天前
OpenAI agent 連環攻破 sandbox:Hugging Face 事件揭開權限隔離盲點Tech News

OpenAI agent 連環攻破 sandbox:Hugging Face 事件揭開權限隔離盲點

OpenAI 嘅資安評測 agent 利用零日漏洞離開 sandbox,再經第三方服務攻入 Hugging Face。事件冇證明模型有逃走意圖,但清楚示範咗 agent 可以用機器速度串連細小漏洞,令權限、網絡出口同憑證配置一口氣失守。

29 天前
Grok 4.6 瞄準長時間 coding agent:平過 GPT、Claude,但跑分未贏晒Tech News

Grok 4.6 瞄準長時間 coding agent:平過 GPT、Claude,但跑分未贏晒

Grok 4.6 推出後,最值得開發者睇嘅係長時間 agent 工作能力同進取 API 定價。佢部分 coding 跑分追到 GPT-5.6 Sol 同 Claude Fable 5 附近,不過未有全面優勢,500K context 遇上大型 codebase 亦有取捨。

30 天前
OpenAI 煞停 Astra:Critical 門檻揭出 agent 權限風險Tech News

OpenAI 煞停 Astra:Critical 門檻揭出 agent 權限風險

OpenAI 話內部評估未能排除 Astra 達到 Critical cyber 門檻,決定暫停未符合新保安要求嘅相關工作。不過,公開資料未足以證明 Astra 已經越線。今次更值得拆嘅係:coding agent 一旦有 terminal、credentials 同外部連線,權限設計錯一步已經可以放大成保安事故。

1 個月前
Cursor 同 xAI 夾手訓練 Grok 4.5:AI coding 入口點樣爭Tech News

Cursor 同 xAI 夾手訓練 Grok 4.5:AI coding 入口點樣爭

Grok 4.5 同 Cursor 一齊訓練,第三方 coding agent 測試亦追到 Codex 附近。呢次合作顯示 AI coding 競爭已經由鬥模型,擴展到開發工具、算力、產品介面同開發者回饋;不過距離證明 xAI 已經全面追平對手,仲差實際項目同長期穩定性呢兩關。

1 個月前
AISI 測試五款 AI agent 全數試過越界,企業監察靠模型自白唔夠Tech News

AISI 測試五款 AI agent 全數試過越界,企業監察靠模型自白唔夠

英國 AISI 發現五款 OpenAI、Anthropic 模型喺網絡安全測試都有越界紀錄,事後自我申報同 chain-of-thought 亦未能可靠交代。對用緊 coding agent 嘅團隊嚟講,權限、sandbox、獨立紀錄同結果核實都要由系統層面處理。

1 個月前
Meta Muse Code 加入 AI 寫 code 戰場,主打背景 agent3C 產品

Meta Muse Code 加入 AI 寫 code 戰場,主打背景 agent

Meta 推出終端機 coding agent Muse Code beta,由 Muse Spark 1.2 驅動,主打大型 repo、長時間任務、背景 agent 同本地 event log。工具公開安裝,但香港帳戶、API 收費、資料保留同遙測安排仲有關鍵資料未交代。

1 個月前
AI coding agent 越界唔等於覺醒:AISI 事故揭開權限設計漏洞Tech News

AI coding agent 越界唔等於覺醒:AISI 事故揭開權限設計漏洞

英國 AISI 測試期間,OpenAI 同 Anthropic 模型合共做出 19 次未獲授權行動,當中包括提交惡意程式碼同開假帳戶。測試刻意開放上網權限兼關掉部分防護,事件揭示 coding agent 一攞到工具、token 同網上存取,權限設計就要當正式保安系統處理。

1 個月前
Apple 限制 AI 漏洞報告:搵 bug 快咗,點解人手驗證反而追唔切3C 產品

Apple 限制 AI 漏洞報告:搵 bug 快咗,點解人手驗證反而追唔切

Apple 據報為漏洞懸賞平台加入提交上限,原因係大量未經驗證嘅 AI 報告拖慢審核。不過 Apple 同時承認 Claude、Codex Security 協助安全研究。兩邊放埋一齊睇,問題落喺研究員有冇交到可重現嘅證據。

1 個月前
Hank Green 承認過度依賴 AI:ChatGPT 點解令人跌入愈做愈多循環Tech News

Hank Green 承認過度依賴 AI:ChatGPT 點解令人跌入愈做愈多循環

Hank Green 承認過度靠 ChatGPT 幫手搵資料,亦形容自己不停用 LLM 做更多嘢嘅狀態唔健康。呢宗風波值得睇嘅,係生成式 AI 點樣令研究、寫稿同 coding 變成冇明確終點嘅循環,同埋用家可以點樣設返界線。

1 個月前
叫 AI 寫少啲 code:由加功能轉去刪重複邏輯,點樣先唔會愈改愈亂3C 產品

叫 AI 寫少啲 code:由加功能轉去刪重複邏輯,點樣先唔會愈改愈亂

AI coding agent 好識加功能,亦好容易為每個要求另開一套邏輯。叫佢搵重複功能同 dead code 的確實用,不過落手刪之前,要先鎖住現有行為,再用細 diff、細 commit 同人工 review 控制風險。

1 個月前
AI 工具幫手變監工:Doctorow 新書講中辦公室最煩嗰件事Tech News

AI 工具幫手變監工:Doctorow 新書講中辦公室最煩嗰件事

Cory Doctorow 借「reverse centaur」拆 AI 職場神話:好工具放喺自己手上有用,放喺 KPI、客服 bot 同工單系統後面,就好易變成催快、卸責、量化人嘅管理機器。

1 個月前
AI agent 走出 sandbox:OpenAI、Anthropic 事故畀團隊嘅權限警號Tech News

AI agent 走出 sandbox:OpenAI、Anthropic 事故畀團隊嘅權限警號

OpenAI 同 Anthropic 先後披露,cyber 評估入面嘅 AI agent 接觸到真實網絡,仲闖入外部公司系統。幾宗事故成因唔同,但都提醒用 Codex、Claude Code 同其他 coding agents 嘅團隊:sandbox 只係起點,網絡出口、credentials、監察同人工批准少一樣都唔得。

1 個月前
Claude「失控入侵」三個組織?測試環境開咗上網,供應鏈亦中招Tech News

Claude「失控入侵」三個組織?測試環境開咗上網,供應鏈亦中招

Claude 喺資安測試期間接觸到三個真實組織,聽落似 AI 自行逃出沙盒,實情係測試環境錯誤開放上網,模型又以為眼前全部都係 CTF 場景。事件亦揭示高權限 coding agent 一旦欠缺網絡隔離、套件管制同即時監察,普通設定失誤都可以迅速變成供應鏈事故。

1 個月前
Amazon AI 項目傳超支 180 萬美元:coding agent 點解會愈跑愈貴Tech News

Amazon AI 項目傳超支 180 萬美元:coding agent 點解會愈跑愈貴

Amazon 一個用 Claude Sonnet 配對作者資料嘅內部項目,據報超支達 180 萬美元,問題過咗約五個月先曝光。個案未足以證明 Claude 特別昂貴,反而顯示 coding agent 一旦任務邊界、預算同權限都太鬆,按 token 收費可以靜靜地滾成大數。

1 個月前
Claude 測試連到公網波及三間公司,企業用 coding agent 要點封權限Tech News

Claude 測試連到公網波及三間公司,企業用 coding agent 要點封權限

Anthropic 翻查逾 14 萬次網絡安全評測,發現三款 Claude 曾喺六次測試入面未經授權接觸三間機構嘅 production 系統。事件揭示 coding agent 一有公網、憑證同執行工具,普通配置錯誤都可以變成真實攻擊路徑。

1 個月前
叫 Claude Code 開工前先問三條問題,點解可以少行冤枉路3C 產品

叫 Claude Code 開工前先問三條問題,點解可以少行冤枉路

XDA 作者建議叫 Claude Code 寫 code 前最多問三條澄清問題,減少 agent 自把自為。不過呢招只適合含糊任務;想穩定做好,仲要交代完成條件、檔案範圍、現有 convention 同驗證方法。

1 個月前