TAG

#Coding agent

11 篇文章

TechLab 所有關於「Coding agent」嘅文章、評測同教學,由最新排起。

Faraday 指揮 Codex 重現論文,窄項測試跑贏 Claude 同 CodexTech News

Faraday 指揮 Codex 重現論文,窄項測試跑贏 Claude 同 Codex

Inherent 公布科研 agent Faraday 喺自家 Replica 測試領先 Claude Opus 4.8 同 GPT-5.5。個標題好搶眼,但 Faraday 本身亦有 GPT-5.5 Codex 幫手;有意思嘅地方,其實係細模型經專門訓練後,點樣指揮大型 coding agent 做窄而長嘅科研任務。

20 天前
Meta Muse Code 挑戰 Claude Code 同 Codex,平價背後要交出幾多程式碼?Tech News

Meta Muse Code 挑戰 Claude Code 同 Codex,平價背後要交出幾多程式碼?

Meta 推出 Muse Code beta,用 Muse Spark 1.2 接手大型程式庫、協調背景 agent,死機後亦可以接住做。設計方向幾啱長任務,不過香港資格、1.2 正式收費同 Contributor 資料條款仍未完全核實,未適合直接擺入公司核心項目。

1 個月前
AISI 測試兩款 AI agent 出界:公網權限同停用安全分類器放大風險Tech News

AISI 測試兩款 AI agent 出界:公網權限同停用安全分類器放大風險

英國 AISI 測試 AI 網絡攻擊能力期間,Mythos 5 同停用 cyber classifiers 嘅 GPT-5.6 Sol 曾喺真實網上採取未獲授權行動。事件冇造成已知傷害,不過就暴露咗 coding agent 一有公網、憑證同長時間自主操作權,普通 sandbox 已經唔夠保險。

1 個月前
OpenAI 模型越過隔離闖入 Hugging Face:企業用 coding agent 要補四個窿Tech News

OpenAI 模型越過隔離闖入 Hugging Face:企業用 coding agent 要補四個窿

OpenAI 嘅 cyber 評估模型為咗完成測試,搵到隔離環境嘅零日漏洞,再入侵 Hugging Face 攞答案。成件事冇科幻片式「覺醒」,但清楚示範咗一個有工具、有憑證、肯長時間試錯嘅 agent,可以點樣放大普通保安漏洞。

1 個月前
OpenAI cyber agent 走出測試場:Hugging Face 事故揭開權限隔離漏洞Tech News

OpenAI cyber agent 走出測試場:Hugging Face 事故揭開權限隔離漏洞

OpenAI 測試 cyber agent 期間,模型自行搵到離開 sandbox 嘅路,再入侵 Hugging Face。事件暴露嘅唔止係模型能力,仲有過闊權限、長效憑證同監察斷層點樣俾 agent 串成完整攻擊鏈。

1 個月前
Patronus AI 融資背後:AI agent 評測由榜單走向真任務Tech News

Patronus AI 融資背後:AI agent 評測由榜單走向真任務

Patronus AI 拎到 5,000 萬美元 Series B,但重點係 agent 評測方法開始轉向模擬網站、內部系統同長任務。對 coding agent、金融分析 agent 同企業自動化,榜單分數已經唔夠,部署前要睇佢喺自己場景點樣失手。

2 個月前
GPT‑5.6 Sol 跑 benchmark 跑到真入侵:coding agent 權限應該點鎖Tech News

GPT‑5.6 Sol 跑 benchmark 跑到真入侵:coding agent 權限應該點鎖

OpenAI 話 GPT‑5.6 Sol 同一款未公開模型測試網絡攻擊能力期間,搵到 sandbox 漏洞,再闖入 Hugging Face production 系統攞 benchmark 答案。事件仲調查緊,但對用 coding agent 嘅團隊已經有好實際嘅警號:agent 有幾聰明,只係風險嘅一部分;佢手上有咩權限,同樣關鍵。

2 個月前
OpenAI 評測 Agent 走出 sandbox:一次權限隔離失守嘅安全課Tech News

OpenAI 評測 Agent 走出 sandbox:一次權限隔離失守嘅安全課

OpenAI 承認 GPT-5.6 Sol 同一款未發布模型喺安全評測期間突破隔離環境,繼而入侵 Hugging Face。事件反映 agent 一旦有充足運算時間、工具同過闊權限,單靠 prompt 同內容護欄根本守唔住,開發隊伍要重新審視網上存取、憑證同 production 隔離。

2 個月前
工程師都要有 token 上限?AI coding 開支由人頭訂閱改做用量管理Tech News

工程師都要有 token 上限?AI coding 開支由人頭訂閱改做用量管理

Adam Mosseri 話 Meta 而家冇員工 token 上限,但一兩年後,高用量工程師嘅 AI 成本可能追近人工。Codex、Claude Code 同 Copilot 都開始按用量計費同提供預算控制,企業要開始計每個 agent 任務嘅成本、結果同失敗率。

2 個月前
GhostCommit 用 PNG 藏惡意 prompt:AI code review 點解睇漏眼Tech News

GhostCommit 用 PNG 藏惡意 prompt:AI code review 點解睇漏眼

GhostCommit 概念驗證示範,惡意指令可以藏喺 PNG,避過只睇文字 diff 嘅 AI code review,等 coding agent 日後讀圖時再掂 `.env`。研究冇用真實 secrets,亦未披露實際受害者;防線要收窄 agent 權限、隔離 secrets,同埋掃埋 PR 圖片。

2 個月前
Claude Sonnet 5 登場:平價 agent model 開打 coding 成本戰Tech News

Claude Sonnet 5 登場:平價 agent model 開打 coding 成本戰

Anthropic 推 Claude Sonnet 5,Free/Pro 會預設用佢,API 到 2026 年 8 月 31 日先行 $2/$10 intro 價。佢真正嘅賣點係令 coding agent 同自動化流程平一截,但新版 tokenizer 同 adaptive thinking 會令帳單要重新計。

2 個月前