1 篇文章
TechLab 所有關於「模型量化」嘅文章、評測同教學,由最新排起。
Gemma 4 E4B 用 4-bit 量化後,8GB 電腦可以開到,不過長 context 會食 RAM 又拖慢速度。呢篇拆清 GGUF、Ollama 同 Apple Silicon 嘅差別,再睇摘要、寫 code 同文件分析去到咩程度。