Meta Muse Code 挑戰大型 codebase:背景 agent 同驗證流程有咩用
Tech News

Meta Muse Code 挑戰大型 codebase:背景 agent 同驗證流程有咩用

圖片:via TechCrunch — https://techcrunch.com/2026/08/05/meta-launches-muse-code-an-ai-agent-for-large-code-bases/
TechLab 編輯部(譯)·

macOS、Linux beta 先行,收費同資料條款仍有缺口

Meta 推出 Muse Code beta,定位幾直接:畀 agent 接手牽涉大量檔案、要做幾個鐘甚至更耐嘅軟件工程工作。佢會先規劃改動,再寫 code、跑工具同驗證結果,背後用新嘅 Muse Spark 1.2。TechLab 未有實試,所以暫時可以確認嘅係產品設計同 Meta 公布嘅測試,實際識唔識處理你公司嗰堆十年舊 code,仍然要逐個 repo 試。

常駐背景 agent 有咩實際用

Muse Code 會保留幾個專門背景 agent,成個 session 都唔會熄掉重開。佢哋可以預先搵相關模組、追依賴關係或者準備下一步,適合大型 codebase 入面經常遇到嘅「改一個 interface,十幾個 package 一齊郁」。工作夠大時,Meta 話佢會拆畀多個 agent,放喺分開嘅 Git worktree 同時處理,唔會直接掂你而家嗰份 working copy,減少平行修改互相撞爛嘅機會。

呢套設計仲有個幾實際嘅細節:每次模型呼叫、工具執行、批准同修改,都會追加落本機 event log。程式中途 crash,可以按紀錄接住做,唔使重新讀完整個 repo。內置嘅 /plan 會先畀人批核計劃,/grill 專門挑戰計劃入面嘅漏洞,/goal 就一路追住指定結果做。對長任務嚟講,可復原同有清楚紀錄,往往有用過單次答得幾醒。

Muse Code 同 Muse Spark 1.2 發布頁嘅藍色線條主視覺

圖片:Meta AI Research

Muse Spark 同個 agent 綁得好緊

Meta 特登用 Muse Code 嘅工具、subagent、context compaction 同長任務軌跡一齊訓練 Muse Spark 1.2。好處係模型熟悉自己身處嘅環境,知道幾時拆工作、保留咩背景,同埋點樣驗證改動;代價係表現有幾多來自模型、有幾多來自 Muse Code 個 harness,會愈來愈難分。換第二個 coding agent 未必有同一效果,團隊日後轉供應商亦可能要重做指令、權限同驗收設定。

Meta 公布嘅 Terminal-Bench 2.1 coding agent 成績比較圖

圖片:Meta AI Research

Benchmark 數字要識得拆

Meta 嘅方法報告交代得算清楚:Terminal-Bench 2.1 跑齊 89 個任務,每題五次;DeepSWE 1.1 有 113 題,涵蓋 91 個 repo 同五種語言,同樣計五次平均。不過各模型配搭各自產品,Muse Spark 用 Muse Code、Claude 用 Claude Code、OpenAI 模型用 Codex。DeepSWE 官方榜本身會統一用 mini-swe-agent,Meta 呢輪就冇統一 harness,所以圖表量度緊成套模型加 agent,唔可以直接當模型能力排名。

另一組 Meta Internal Coding Bench 有 440 個來自公司內部 codebase 嘅真實改動,包含修 bug、加功能同 refactor。呢類題目確實貼近大型 monorepo,但外界睇唔到題目,亦冇辦法獨立重跑。Meta 仲展示過 agent 用逾 1,000 次工具呼叫、最長跑 24 小時去調校 GPU kernel;呢啲只係官方測試,未足以證明一般 production repo 都有同樣穩定度。

同 Claude Code、Codex CLI、Gemini CLI 點分

Claude Code 已經有較完整嘅終端機、自動化、權限同企業部署選項,macOS、Linux、Windows 都有官方路線;Codex CLI 就有清楚嘅 sandbox、批准政策、非互動執行同 code review 指令,仲可以接雲端任務。Muse Code 暫時最突出嘅地方,係常駐背景 agent、長任務復原同規劃審查一套包晒。較少設定就可以試大型工作,但 beta 成熟度同企業管控資料仍然少過兩個主要對手。

Gemini CLI 個程式本身採用 Apache 2.0 開源,模型 context、Google 工具同擴充生態一直係賣點,亦方便團隊檢查 agent 點執行。不過 Google 喺 2026 年 6 月開始把個人帳戶嘅終端機體驗轉去 Antigravity CLI,企業授權同 API key 就繼續支援。呢個例子亦提醒咗大家:coding agent 變得好快,唔好因為今日有免費額度或者某種登入方式,就假設半年後仲係同一安排。

安裝、價錢同地區仍有問號

Muse Code 官方而家只列出 macOS 同 Linux,安裝方法係下載遠端 script 再交畀 shell 執行;公司機最好先檢查 script,亦應經內部套件管理發放。Meta 話 Muse Spark 1.2 擴大至全球使用,但冇公開完整地區名單,香港帳戶能否即時開 key、要唔要先加付款方法,仍要喺 developer portal 確認,Windows 原生版本亦未見公布。

收費方面,Muse Spark 1.1 公開價係每百萬 input token 1.25 美元、output token 4.25 美元,可以當成本參考。不過 Muse Code 有冇另設月費、Spark 1.2 最終價、rate limit 同新帳戶額度,Meta 今次公開文章都冇寫清楚,全部係 [待確認]。外間提到嘅 contributor 優惠亦未見公開 Meta 條款足以核對,未搞清楚 code 同輸出會點用之前,唔應該靠平價吸引就開畀公司 repo。

私隱資料先當未交代

大型 codebase 入面通常混有客戶邏輯、內部 URL、憑證名稱、debug log 同未公開產品資料。Muse Code 雖然喺本機操作檔案同保存 event log,模型推理仍要連去 Meta 服務;公開發布頁冇列明 prompt、code、工具輸出嘅保留期,亦冇清楚交代標準帳戶會唔會用作訓練。developer portal 未登入亦睇唔到完整帳戶條款,所以資料保留、刪除、訓練選項同企業保障暫時都係 [待確認]

試 beta 時應該先用可公開或者經清理嘅 repo,排除 .env、私鑰、production dump 同客戶資料,再限制 agent 可寫嘅路徑同網上權限。每個改動仍要經 diff review、測試、靜態分析同 CI;event log 證明到 agent 做過咩,證明唔到改出嚟嘅 code 一定啱。Muse Code 值得大型舊系統團隊留意,但正式接公司原始碼之前,先等 Meta 補齊資料條款、收費表同獨立測試會穩陣好多。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook