
Unsloth Dynamic v3.0 同容量留多啲精度,本機跑 Qwen 有咩實際分別
量化分配聰明咗,但速度同逾 10% Top-1 命中率要分開睇
同樣咁大,點解可以準啲?
Unsloth 推出 Dynamic v3.0,首批模型係 Qwen3.8-27B。核心做法係用重新整理嘅 imatrix 校準資料,判斷模型入面邊啲權重對壓縮特別敏感,再按層同張量揀量化方法。可以理解成同一個容量預算下,怕失真嘅位置留高啲精度,冇咁敏感嘅位置就壓得重手啲,所以整體檔案唔使變大,輸出仍然可以貼近 BF16 原版多啲。
呢套方法仍然屬於訓練後量化,冇重新訓練模型,亦冇用 QAT 或 QAD。Dynamic 2.0 本身已識按模型同層分配唔同量化格式,v3.0 今次再換走偏重一般文字嘅校準組合,加入 agent coding、對話、多語言、數學同長文件內容。呢個改動幾實際:聊天模型平時見到嘅 prompt,同攞 Wikipedia 文字做校準始終係兩回事。

圖片:Unsloth
「高逾 10%」唔等於答題分數升 10 分
Unsloth 話,部分 UD-3 版本喺相若磁碟容量下,首選 token 同 BF16 對得上嘅比例可領先其他量化版本逾 10%。iThome 報道亦提到,9.83GB 版本大約高過次佳方案 8%。不過 Top-1 命中率唔等同 MMLU、寫 code 成功率或者答案正確率;佢只反映每一步最想揀嗰個 token 有幾常跟足原版,唔可以直接當成實際能力升幅。
Unsloth 今次另用 300 組冇放入校準資料嘅 prompt,比較各版本連續生成 32 個 token 時同 BF16 偏離幾遠,內容包括 Terminal-Bench 2.1、DeepSWE、Harbor、MathArena、非拉丁文字同長文件。呢個測法貼近生成工作多過只睇第一個 token,不過數據、量化方法同評估流程都由 Unsloth 自己提供;截至發布時,未見第三方用同一設定完整重跑 Dynamic v3.0。
揀邊個版本,先睇 RAM/VRAM
Qwen3.8-27B 嘅 UD-Q4_K_XL 檔案約 17.9GB,Unsloth 建議預 17GB 至 19GB 總 RAM 加 VRAM;3-bit 約要 13GB 至 16GB,2-bit 就係 11GB 至 13GB。換句話講,16GB 顯示卡未必可以完整放入建議嘅 4-bit 版,通常要分一部分去系統 RAM。Mac 用統一記憶體會方便啲,但 16GB 機仍然相當緊,因為系統、KV cache 同其他 app 都要分記憶體。
官方列出 256K context,但唔好將 17GB 至 19GB 當成任何 context 長度都夠。對話愈長,KV cache 食得愈多;開大 context、處理圖片或者同時跑多個 session,所需記憶體都會升。實際揀機時,24GB 統一記憶體或者 32GB 系統 RAM 跑 4-bit 會鬆動過貼住最低數字,想全數放入 GPU 就要預更多 VRAM。
Ollama、LM Studio 同 llama.cpp 使唔使改玩法?
Dynamic v3.0 產物仍然係 GGUF,模型頁已提供 llama.cpp 同 Ollama 嘅直接載入方法;LM Studio 亦可以匯入外部 GGUF,底層用 llama.cpp engine。即係原有本機 workflow 大致照舊,唔使為新量化另裝專用推理框架。對已經用本機 OpenAI-compatible server 接駁 coding agent 或內部工具嘅人,主要改動只係換模型檔同重新調校 context、GPU offload。
至於速度,Unsloth 呢輪發表未提供 Dynamic v3.0 對其他同容量 GGUF 嘅 token/s 數字,所以未有證據話佢一定快。量化級別、K-quant 或 I-quant、CPU 指令集、Metal/CUDA backend、GPU offload 比例同 context 長度都會左右速度;llama.cpp 嘅支援表亦顯示,部分 I-quant 喺 CPU 或 Metal 會慢過相若容量嘅 K-quant。想要穩陣表現,可以由官方建議嘅 4-bit K-quant 開始,再按自己部機試 3-bit 或 I-quant。
對本機 AI 真正有幾大影響?
如果你本身已經用 Mac、Windows PC 或工作站跑 GGUF,Dynamic v3.0 最大價值係同一段記憶體預算有機會少犧牲一截模型行為,尤其 coding、多語言同長對話呢類量化誤差容易一路累積嘅工作。資料亦可以留喺自己部機,減少交畀雲端 API 嘅內容同按 token 收費;不過接駁搜尋、遙距工具或其他網上服務時,資料會唔會外傳仍然要睇個 workflow 點設定。下一步要等第三方用固定硬件重跑準確度、速度同長 context 測試,亦要睇 v3.0 擴展去其他模型後仲有冇同樣效果。
參考來源
- iThome — Unsloth更新Dynamic v3.0 GGUF量化方法,相同檔案尺寸下提高量化模型精度 — original report
- Unsloth Dynamic 3.0 GGUFs — 官方技術說明,列出校準資料、層選擇、300 組保留測試同 32-token 評估方法。
- Qwen3.8-27B — 官方模型頁,提供各量化級別嘅總記憶體要求同建議版本。
- Qwen3.8-27B-GGUF 模型頁 — 核對 GGUF 檔案大小、llama.cpp/Ollama 載入方法同模型版本。
- llama.cpp Feature Matrix — 核對 K-quant、I-quant 喺各硬件 backend 嘅支援同速度注意事項。
- LM Studio 匯入外部模型說明 — 確認 LM Studio 可以匯入外部 GGUF 模型。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







