TAG
#模型量化
3 篇文章
TechLab 所有關於「模型量化」嘅文章、評測同教學,由最新排起。
Tech NewsUnsloth Dynamic v3.0 同容量留多啲精度,本機跑 Qwen 有咩實際分別
Dynamic v3.0 用新校準資料重新判斷邊啲模型層最怕壓縮,令 GGUF 喺相若容量下少失一截精度。首個版本落喺 Qwen3.8-27B,Ollama、LM Studio 同 llama.cpp 都用得,不過官方暫時冇交代 token 速度,準確率數字亦未有獨立測試確認。
21 天前
3C 產品28.9M 參數塞入 ESP32-S3:拆開 14.9MB 離線故事模型
一個 28.9M 參數模型,點樣塞入只有 16MB flash、8MB PSRAM 嘅 ESP32-S3?關鍵係將大量 PLE 參數留喺 flash,逐個 token 查表,再用 4-bit 量化壓細模型。不過佢只識續寫簡單英文故事,效能數字亦暫時得作者自己測到。
2 個月前
3C 產品Gemma 4 E4B 本機運行指南:8GB 開到,量化同 context 決定實際表現
Gemma 4 E4B 用 4-bit 量化後,8GB 電腦可以開到,不過長 context 會食 RAM 又拖慢速度。呢篇拆清 GGUF、Ollama 同 Apple Silicon 嘅差別,再睇摘要、寫 code 同文件分析去到咩程度。
2 個月前