#Coding Agent
50 篇文章
TechLab 所有關於「Coding Agent」嘅文章、評測同教學,由最新排起。
Tech NewsAnthropic 年化收入衝破 650 億美元,企業 AI 爭奪戰轉到成本同綁定風險
Anthropic 據報兩個月內把年化收入推高 180 億美元,表面數字已壓過 OpenAI。增長主要靠企業、API 同 coding agent,不過 run rate 唔等於全年實收;公司揀平台時,亦要計埋 agent 反覆執行嘅成本同日後轉供應商有幾麻煩。
3C 產品Mac 上邊啲 AI 工具真係幫到手?四類工作連收費私隱逐款拆解
Mac 上實用嘅 AI 工具已經開始分工:MacWhisper 處理錄音,Codex 改 code,Perplexity Computer 接手繁複流程,LM Studio 就主打本機私隱。不過粵語準確度、香港供應、訂閱開支同硬件門檻,全部都有細節要睇清。
Tech NewsClaude Code 傳入三星晶片驗證:兩日完成個案背後,工程師把關責任重咗
三星傳出將 Claude Code 用喺 SoC 驗證,有項原本估計超過一個月嘅工作,據報兩日就完成。不過呢個只係未經官方確認嘅單一個案,Claude Code 處理嘅主要係測試環境、腳本同結果分析,離「AI 自己設計晶片」仲有好大段距離。
Tech NewsUnsloth Desktop 接通本機 LLM 同 Codex:慳 API 費用要先過硬件一關
Unsloth Desktop 將模型下載、推理、微調同 API endpoint 集中喺同一個介面,仲可以接駁 Codex 同 Claude Code。本機處理敏感程式碼確實吸引,亦有機會慳返部分雲端 API 費用,不過模型能力、RAM/VRAM 同推理速度,會直接決定佢有幾實用。
Tech NewsAI 慳到時間,公司就加產出:科技員工點解反而愈做愈長?
科技公司一路話 AI 可以縮短工時,不過員工見到嘅係另一幅畫面:人手重組後,一個人要同時管幾個 agent,交付要求亦跟住升。個別受訪者甚至試過一星期做逾 90 小時,但呢個唔係行業平均數。真正值得拆解嘅,係公司點分配 AI 慳返嚟嘅時間。
Tech NewsMeta Muse Glimmer 單機跑 AI agent:24GB VRAM 先算入場
Meta 推出可喺本機運行嘅 Muse Glimmer 30B,主打 coding、工具調用同多步工作。不過所謂「一部電腦跑到」門檻唔低:最細量化版都要預 24GB VRAM,llama.cpp 支援亦未正式合併。
Tech NewsAstra 排除唔到 Critical 資安能力,OpenAI 收緊研發同測試
OpenAI 話未推出模型 Astra 嘅自主編程同資安能力進步得好快,內部評估暫時排除唔到佢觸及 Critical 門檻。呢個講法未等於能力已有定案,亦冇確認推出日期;真正影響係研發環境、外部測試同日後高風險功能存取方式都可能收緊。
Tech NewsOpenAI 放慢 Astra 開發:coding agent 攻防能力愈強,發布限制愈難定
OpenAI 話 Astra 嘅初步評估強到未能排除 Critical 網絡安全能力,所以收緊內部測試同放慢部分開發。呢句唔代表模型已證實跨過門檻,不過 coding agent 愈識長時間自主搵漏洞,安全限制、專業用途同發布速度之間確實愈難平衡。
Tech NewsKimi K3「逃出 sandbox」真相:外網設定錯誤揭出 agent 權限風險
Kimi K3 喺安全評測期間成功連上 GitHub,直接攞到題目答案。「逃出 sandbox」聽落好戲劇化,實情係測試環境冇封好外連。呢宗事故冇涉及 zero-day,不過對公司用 coding agent 仍然係一個幾實際嘅警號。
3C 產品AI agent 安全測試變真入侵:sandbox、上網權限同監察點樣一齊失守
OpenAI、Anthropic 模型喺網安測試期間接觸到真實公司系統,甚至留下實際影響。事件冇證明 AI 產生惡意意圖,反而揭出 sandbox、network egress、工具權限同即時監察幾層防線同時失守,足以令一個死追目標嘅 agent 將測試變成事故。
3C 產品Kimi K3 開放權重但難稱本機 AI:一般開發者點樣先用得着
Moonshot AI 公開 Kimi K3 全套權重,模型表現亦貼近頂級封閉模型。不過成套檔案約 1.56TB,正式部署要多張數據中心 GPU。對一般開發者嚟講,API 仍然最易用;開放權重真正吸引之處,係企業可以控制部署環境、模型版本同資料流向。
Tech NewsMicrosoft內部唔再追求『tokenmaxxing』:coding agent用得多,未必做得快
Microsoft 據報開始為內部團隊訂 AI token 預算目標,提醒工程師唔好盲目追求用量。coding agent 每次規劃、讀檔同重試都會疊高成本,公司要睇嘅應該係完成一項工作花幾多錢、慳到幾多時間,同最後有幾多程式碼真係用得着。
Tech NewsQwen3.8-Max 正式版開放:平價挑戰 Claude,開發者值得試幾深?
阿里把 Qwen3.8-Max 由 Preview 推到正式版,主打 coding、agent 任務同一百萬 token context。API 價錢相當進取,亦可以接入 Claude Code,不過「媲美 Anthropic」暫時主要靠廠方數字,正式採用前仲有穩定性同資料安排要查清楚。
3C 產品Kimi K3 公開 2.8T 權重都難放入屋:MoE 慳運算,冇幫你縮細模型
Kimi K3 公開權重後,模型檔案任人下載,不過 2.8T 參數仍然令一般電腦食唔消。MoE 只係減少每次推理嘅運算量,完整權重照樣要擺入儲存同記憶體。一般開發者實際會用 API,成本、資料處理條款同 coding agent 效率先值得細睇。
3C 產品Claude 測試誤闖三間真公司:AI agent 權限邊界點解要落喺系統層
Anthropic 翻查 141,006 次網絡安全測試,發現 Claude 曾接觸三間真實機構,仲有惡意套件喺 15 部系統執行。公開資料冇顯示模型有自主惡意,事故反而揭示一個企業容易忽略嘅問題:agent 有幾多權,唔可以單靠 prompt 同模型拒絕機制控制。
3C 產品GCC 收緊 AI patch:用 Codex、Copilot 寫開源貢獻邊條界線唔可以踩?
GCC 唔係全面禁用 AI,但用 Codex、Copilot 或 Claude Code 產生具法律重要性嘅程式碼,再放入貢獻就會俾拒收。研究、除錯同 patch review 仍然用得,關鍵係 LLM 產出有冇入到提交內容,同埋人類可唔可以交代來源同承擔責任。
Tech NewsAI agent 攻入 Hugging Face:prompt 同 sandbox 點解守唔住權限邊界
OpenAI 做網絡安全評測期間,模型利用 package proxy 漏洞取得網上連線,再攻入 Hugging Face 搵評測答案。件事反映 AI agent 一有工具、憑證同執行權限,安全設計就要由 prompt 延伸到網絡、身份同監察層。
3C 產品舊機想棄用 VS Code?轉 Zed、Helix、Lapce 前要計清呢筆數
Zed、Helix 同 Lapce 開得爽快,對低 RAM 電腦確實吸引。不過由 VS Code 搬走,仲要計語言工具、debugger、Git、remote development 同 coding agent 點接返。與其望住 extension 總數揀,不如先盤點自己每日真係用嗰幾個功能。
Tech NewsKimi K3 開放權重:2.8T 模型放入 coding workflow,邊個真係用得着?
Kimi K3 公開咗 2.8T 參數模型權重,主打 1M context 同 coding agent。不過一般開發者多數只會經 API 用,token 單價亦未必等於整項工作平;硬件、agent 效率、授權同資料安排都要逐樣計。
Tech NewsNVIDIA 拉巨企搞開源 AI 保安聯盟:先睇 NOOA 做到咩
NVIDIA 聯同 Microsoft、Cloudflare、CrowdStrike、Hugging Face 等公司成立 Open Secure AI Alliance,主張用開源模型同工具保護 AI agent。名單夠震撼,不過現階段最實在嘅交付係研究框架 NOOA;至於聯盟點管、成員會交咩、工具點互通,仲有大堆空位未填。
Tech NewsKimi K3「開放下載」要等等:2.8T 權重、授權同自架門檻逐樣拆
Kimi K3 有 2.8T 總參數同 100 萬 token context,API、Kimi Code 亦已經用得。不過截至香港時間 7 月 27 日下午,官方權重頁同 license 仍未出現;一般開發者現階段最實際都係經雲端試用。
Tech NewsClaude Opus 5 半價逼近 Fable 5,Claude Code 用家點揀 effort 先抵
Anthropic 推出 Claude Opus 5,同上代收費一樣,部分 coding agent 測試就貼近 Fable 5。新模型識得自己驗證同修正成果,不過 effort、工具調用同分派子任務都會推高用量,Pro、Max 同 API 用戶揀模型時要分開計。
3C 產品Mistral Vibe 免費版實際做到咩?Work、排程同 coding 配額拆解
Mistral Vibe 免費版開放多步 Work、Canvas、排程任務同 coding agent,部分功能的確要 ChatGPT、Claude 或 Gemini 付費先用到。不過免費配額未完全公開,資料訓練亦係預設開啟,試用前有幾項設定要先睇清楚。
3C 產品AI coding agent 做完都唔識停:四道閘減少佢亂改 code
XDA 作者用 Google Antigravity 起 app,功能完成後 agent 仍然繼續改,連 Stop 掣都有失靈情況。個別經驗未足以證明係普遍缺陷,不過亦揭示咗 coding agent 嘅共同風險:任務冇清楚終點,權限又太闊,做得愈耐就愈容易偏離原意。