Meta Muse Glimmer 單機跑 AI agent:24GB VRAM 先算入場
Tech News

Meta Muse Glimmer 單機跑 AI agent:24GB VRAM 先算入場

圖片:via Engadget — https://www.engadget.com/2233312/metas-open-source-muse-glimmer-model-can-run-on-a-single-computer/
TechLab 編輯部(譯)·

30B 模型已有 4-bit GGUF,軟件支援仍啱啱起步

Meta 推出 Muse Glimmer 30B,定位好清楚:畀 coding agent 處理程式碼、整理檔案同調用工具,呢類長時間工作都可以留喺自己部機做。呢個方向對要處理私人程式碼、客戶文件或者未公開資料嘅人幾實際,不過「一部電腦跑到」呢句要拆開睇。普通 16GB RAM notebook 冇份,起步點係配備 24GB VRAM 嘅高階 PC,或者有足夠 unified memory 嘅 Mac

17GB 模型檔唔代表只食 17GB 記憶體

Muse Glimmer 係約 29.6B 參數嘅 dense 模型,原裝 BF16 權重接近 60GB,Meta 列明要 64GB VRAM。官方另有兩個約 4-bit 嘅 GGUF:K-Quant-17GB 模型檔實際約 16.76GB,目標硬件係 24GB VRAM;K-Quant-Dynamic 約 19.65GB,目標就係 32GB VRAM。量化會犧牲少量準確度,Meta 自己報告兩者平均跌 1% 同 0.2%,呢啲都係官方測試,暫時未有獨立結果交叉核對

仲要計埋 context 嘅 KV cache、推理程式同作業系統。想睇圖要再載入約 1.4GB perception encoder;想用 DFlash 加速,亦要加約 1.63GB drafter。Meta 雖然標示 131,072+ token context,但 context 開得愈長,記憶體佔用亦會一路升。PC 方面,24GB VRAM 只適合較細量化版,system RAM 官方冇列明;按檔案大小同載入開銷推算,32GB system RAM 可當較穩陣起點,但呢個屬部署估算,唔係 Meta 保證規格

藍色光點同線條組成嘅 Muse Glimmer 官方抽象主視覺

圖片:Meta AI Research

Mac 可以跑,但要記住記憶體係共用

Apple Silicon 嘅 unified memory 同時畀 CPU、GPU 同 macOS 使用,所以 24GB 總記憶體唔等同 PC 顯示卡獨佔 24GB VRAM。純文字、短 context 用細量化版,32GB unified memory 理論上有機會應付;想同時用圖像、DFlash 或較長 context,用 48GB 或以上會穩陣好多。Meta 公布過 M4 Max 同 M5 Max 嘅速度數字,但冇寫明測試機記憶體配置,亦冇公開一般 M 系列 Mac 嘅完整相容表,買機前唔好單憑「支援 Mac」四個字落決定。

GGUF 有得下載,一鍵安裝仲要等

官方 GGUF 已經放上 Hugging Face,不過發稿時 Muse Glimmer 嘅 llama.cpp 支援仍然係一個未合併嘅 pull request,入面仲處理緊 multimodal、DFlash、chat parser 同工具調用。LM Studio 本身用 llama.cpp runtime,有模型檔唔代表現有穩定版已完整識跑;就算載入到文字模型,工具格式、圖像輸入或者 speculative decoding 都可能未齊。Meta 話優化整合會陸續推出,現階段較適合肯更新 experimental build 同自行排錯嘅開發者。

Coding agent 表現有亮點,但未到可以放手做

Meta 公布 Muse Glimmer 喺 SWE-Bench Pro 得 51.2、SWE-Bench Verified 得 76.0,後者稍低過官方對照嘅 Qwen3.6-27B 77.2;TerminalBench 2.1 就係 51.7,落後對手嘅 60.7。呢組官方數字顯示佢幾適合讀現有 repo、改細功能、跑測試、追錯同反覆調用本機工具。大型重構、模糊產品需求或者涉及多個服務嘅改動,仍然要人逐步批核。Meta 話訓練資料涵蓋逾 100 種語言,但冇獨立列出廣東話能力,中文工作亦要再驗證。

Agent 得到 terminal、檔案系統同瀏覽器權限後,本身就有刪檔、洩漏資料同受 prompt injection 影響嘅風險。本機模型減少程式碼送去模型供應商 server,但 agent 一旦獲准調用網上搜尋、Git hosting 或其他 API,資料仍可能離開部機。部署時最好限制工作目錄、保留版本控制,涉及刪除、付款、發送訊息同推送程式碼都要人手確認。

私隱同長期成本先係本機模型嘅賣點

本機運行冇逐 token 收費,長時間掃 repo、整理大量文件或者重複跑 agent,成本會容易預計;代價就係要先有 24GB 至 32GB 級 GPU 或高記憶體 Mac,仲要負責電力、更新同相容問題。雲端模型通常能力較強、開箱快,工作量突然增加亦易處理。較合理嘅用法係把敏感、重複同可驗證嘅工作交畀 Muse Glimmer,複雜推理先按情況用雲端模型。

Meta 將權重、兩款量化檔、視覺 encoder 同 drafter 以 Apache 2.0 發放,商業使用限制少過過往部分 Meta 模型。不過官方模型頁未見完整訓練程式碼,訓練資料亦只交代來源類別,另有一份 Usage Policy 列出用途限制。所以叫佢做開放權重模型會準確啲,距離任何人都可以重現訓練過程嘅完整開源項目仲有一段路。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook