#Coding Agent
50 篇文章
TechLab 所有關於「Coding Agent」嘅文章、評測同教學,由最新排起。
3C 產品Claude Opus 5 用半價 API 逼近 Fable 5,Claude Code 日常點揀
Anthropic 推出 Claude Opus 5,API token 價同 Opus 4.8 一樣,只有 Fable 5 一半。官方數據話新模型喺 coding、電腦操作同知識工作追貼甚至贏過 Fable,不過首批獨立測試顯示,code review 準確度、漏錯同耗用 token 之間仍有取捨。
Tech News美國 AI「Kill Switch」法案拆解:DHS 可限速停機,權力去到幾盡?
美國跨黨派議員提出《AI Kill Switch Act》,要求大型 AI 公司保留限速、暫停同關閉模型嘅技術能力。條文唔代表政府可以任意熄晒全球 AI,不過 DHS 一旦認定發生受規管事故,毋須先攞法庭命令就可以要求公司即時行動,海外 API 同 coding agent 用戶亦可能受波及。
3C 產品Codeberg 禁大量 AI 生成專案:Codex 同 Copilot 仲用唔用得?
Codeberg 更新使用條款,禁止主要由生成式 AI 寫成嘅專案。Codex、Claude 雖然俾官方點名,但新規冇全面封殺 coding agent;真正踩界嘅係開發者交唔交代到程式碼來源、風險同維護責任。至於「主要」點計,官方仲要補充執法細節。
Tech News美軍 AI「不限量」一個月收緊:企業派 token 點先唔會失控
美國陸軍開放 Ask Sage「不限量」使用後,中央 token 池不足一個月就要重新設限。事件未有公開實際支出,亦唔足以證明 AI 用得太多,但就提醒公司:開放 AI 工具之前,要計清楚配額、工作成果同核對成本。
3C 產品黃仁勳稱中國 AI 後門疑慮有誤:Kimi K3 開權重就等於安全?
黃仁勳認為美國公司應該獲准使用中國 AI 模型,又話下載權重後可以自行加防護。不過 open-weight 只係多咗審查同自建空間,訓練資料、模型行為同供應鏈風險唔會自動消失。對開發者同企業嚟講,部署方法同 agent 權限先最影響後果。
Tech NewsKiro 已修補網頁藏指令執行程式碼漏洞,MCP 設定檔成高危入口
Kiro IDE 一個已修補漏洞,曾容許網頁暗藏嘅 prompt 指令改寫 MCP 設定,再以開發者權限執行程式碼。研究團隊確認 0.11.130 已擋住同一攻擊,事件亦提醒團隊:coding agent 嘅核准視窗只係其中一層防線,敏感設定、憑證同執行環境一樣要分隔。
3C 產品Gemini 3.6 Flash 快咗又平咗,開發者應點揀 3.5 Flash-Lite?
Google 一口氣推出 Gemini 3.6 Flash、3.5 Flash-Lite 同 Flash Cyber。對開發者最實際嘅變化,係 agent 工作快咗、輸出 token 平咗;不過兩款通用模型嘅用途同遷移要求差幾遠,Cyber 亦未有公開 API。
Tech NewsBuzz 正式開放:Jack Dorsey 用 Nostr 同 ACP 重砌 AI 開發團隊協作
Block 正式推出開源協作平台 Buzz,想將對話、coding agent、code review、Git 同自動化集中喺同一個 workspace。個方向幾啱 AI 開發團隊痛點,不過手機版、審批、安全驗證同企業功能仍未齊,現階段更適合試玩同自行部署。
3C 產品本機 Qwen 卡住先叫 Claude Fable 5:慳 API 錢但私隱代價唔細
XDA 作者畀本機 Qwen 2.5 Coder 自己判斷幾時向 Claude Fable 5 求救,普通改碼留喺電腦,複雜問題先付 API 錢。不過真正難處係點定義「卡住」、截住失控呼叫,同埋避免私人程式碼跟錯誤資料一齊送上雲端。
Tech NewsKimi K3 平價追到前線,開放權重會點改寫開發者 AI workflow?
Moonshot Kimi K3 同阿里 Qwen3.8 接連挑戰 OpenAI、Anthropic,賣點係接近前線模型嘅能力、較平 API 同開放權重。不過價目只講咗半個故事:agent 用幾多 token、權重點部署、資料放邊度,同樣會影響開發者揀邊個模型。
3C 產品本地 LLM 寫 code 未必輸:細任務靠測試把關,私隱同成本要另計
XDA 作者試用本地 LLM 一星期,發現研究摘要比寫細段 code 更難放心。原因唔係本地模型突然追平頂級雲端 agent,而係程式碼有 compiler、測試同 lint 幫手捉錯。對要處理客戶 code 嘅開發者,本機推理值得用,但私隱、硬件成本同工具能力要分開計。
Tech NewsCursor 出 iOS app:用手機睇 AI agent 寫 code,開發者唔使黐實電腦
Cursor 6 月 29 日推出 iOS app public beta,重點唔係叫你喺細 mon 寫 code,而係用手機睇住 cloud agent 做嘢、補 prompt、睇 logs / diff,必要時直接 merge PR。呢個方向同 Codex、Claude Code 好接近,手機正變成 AI coding agent 控制台。
Tech NewsKimi K3 未放權重先搶 coding 頭位,2.8T 模型點樣壓閉源服務價錢
Moonshot AI 公布 Kimi K3,官方話佢有 2.8 萬億參數、100 萬 token context,同時喺 coding 測試追到頂級閉源模型。不過權重仲未有得下載,API 價亦唔算平。K3 帶嚟嘅壓力,主要係企業多咗議價同自行部署嘅可能。
3C 產品同一個裝修財務 dashboard,Codex、Claude Code、Copilot 點揀先實際
XDA 作者叫三款 coding agent 整同一個裝修財務 dashboard,Codex 交出最完整兼最靚嘅版本,Claude Code 功能深入但介面失色,Copilot 就快得嚟做漏流程。結果幾有意思,不過測試欠缺原始碼、實際用量同自動測試,揀工具前仲要拆開睇。
Tech NewsKimi K3 前端 coding 登頂,但完整權重未公開:平價 API 先行搶客
月之暗面推出 Kimi K3,靠前端 coding 盲測第一名同平價 API 搶焦點。不過官方都承認整體體驗仍落後頂級封閉模型,完整權重亦要等到 7 月 27 日。對開發者嚟講,現階段最實際係用真實 agent workflow 比成本、成功率同穩定性。
3C 產品Qwen3.6 本地駁 coding agent:慳 API 費背後,硬件同權限先要計清
XDA 作者用本地 Qwen3.6-35B-A3B 配合 Pi,叫模型即場寫 TypeScript extension,再控制 Proxmox、Docker 同其他 home lab 服務。接駁方法唔複雜,但速度、記憶體、工具相容性同執行權限,都會直接影響呢套玩法係咪真係啱工作用。
Tech NewsKimi K3 用 2.8T MoE 追 Claude、GPT:coding 強,自己部署仲要等
Moonshot AI 推出 Kimi K3,主打 2.8T MoE、100 萬 token context 同長時間 coding agent。官方測試話表現貼近 Claude Fable 5 同 GPT-5.6 Sol,不過獨立測試見到速度、成本各有取捨,完整權重亦要等到 7 月 27 日。
Tech NewsKimi K3 堆到 2.8T 參數,主打長程 coding 同一百萬 token context
月之暗面推出 Kimi K3,主打 coding agent、原生多模態同一百萬 token context。2.8T 總參數夠搶眼,不過廠方未公布每個 token 嘅實際活躍參數,完整權重亦未上架。開發者而家可以用 API,自己部署就係另一個級數嘅工程。
Tech NewsGemini 3.5 Pro 傳延後:Google 卡喺 coding,開發者要點部署?
Gemini 3.5 Pro 傳出因 coding 表現未達 Google 內部目標,要延後數月推出。消息仍靠匿名知情人士,Google 未有確認新時間表;不過對用緊 Gemini API、AI Studio、Vertex AI 同 coding agent 嘅團隊,現階段已經要重新評估模型部署。
Tech NewsInkling 開放權重兼食盡三種輸入,975B 模型實際有幾開放?
Thinking Machines 推出首款開放權重模型 Inkling,支援文字、圖片同聲音輸入,總參數達 975B。不過模型權重有得下載,唔代表一般電腦跑得郁;佢對開發者最大嘅吸引力,其實係微調、API 部署同 agentic coding。
3C 產品16GB Mac 跑免費本地 coding agent:慳月費要接受細模型限制
XDA 作者停咗每月 US$20 嘅 Claude Pro,改用 16GB MacBook Air 跑 Qwen2.5-Coder 7B。小改動同 debug 可以慢慢磨,複雜工作仍輸畀 Claude;4.7GB 模型檔背後,64K context、RAM 壓力同偏鬆嘅工具權限,都會直接影響日常使用。
3C 產品Anthropic 用 J-Lens 睇到 Claude 入面點轉彎,但意識呢題未有答案
Anthropic 話用 Jacobian Lens 可以讀到 Claude J-Space 入面嘅概念,例如中途算式、prompt injection 警號同測試場景感。重點係,呢啲係可審核嘅內部訊號,唔係 Claude 有感受嘅證據。
3C 產品AI Agent 亂估 repo:HalluSquatting 點樣變成供應鏈風險
HalluSquatting 利用 LLM 亂估 GitHub owner/repo 或 agent skill 嘅習慣,等 coding agent 拉錯資源再執行指令。防法好實際:鎖 repo、審批下載、sandbox,同埋用 least privilege 管住 token 同工具權限。
Tech NewsGemini 3.5 Flash 轉攻 AI agent:香港開發者要睇嘅唔只速度
Google 喺 I/O 推出 Gemini 3.5 Flash,重點唔再係聊天,而係長時間執行任務、寫 code、開 sub-agent。對香港 startup、freelancer 同 IT team,真正問題係可用性、成本、私隱同人手監督。