Unsloth 今天给 Qwen3.8-27B 的 GGUF 做了一次重要升级。新版本用上 Dynamic V3 量化,官方给出的对比是:同样文件大小下,Top-1% 准确率比其他量化方案高 10% 以上。最激进的 1-bit 版本能把模型压到 6.2GB,保留 77% 的准确率,8GB 内存就能跑。
Qwen3.8-27B 是 Qwen 开源家族的最新成员。27B 参数,稠密架构,原生支持图片和视频理解,上下文 262K,可扩展到 1M。Unsloth 称其为同尺寸最强模型。BF16 原始权重需要 54.7GB,所以量化是把模型塞进普通设备的关键。
Dynamic V3 是 Unsloth 自研量化方法的第三次迭代。它换了更高品质的 imatrix 校准数据集,重新设计了层选择策略,并且没有用 QAT 或 QAD,纯靠训练后量化。Unsloth 用 300 条未参与校准的样本做 Divergence-300 测试,对比量化模型和 BF16 在 32 个 token 输出轨迹上的重合度,用来排除过拟合。KLD 结果同样显示,同尺寸下 UD-3 比其他家表现更好。
硬件需求如下,单位是 RAM 加 VRAM 的总量:
| 量化 | 内存 |
|---|---|
| 1-bit | 7-8 GB |
| 2-bit | 9-11 GB |
| 3-bit | 12-14 GB |
| 4-bit | 16-19 GB |
| 6-bit | 23-26 GB |
| 8-bit | 31 GB |
| BF16 | 56 GB |
4-bit 版本 17GB 左右就能跑,24GB 显卡或 32GB 内存的笔记本都带得动。1-bit 版把门槛压到 8GB,适合先体验,不适合当主力。
除了 GGUF,Unsloth 还更新了 NVFP4 量化。Blackwell GPU 上比 BF16 快约 1.5 倍,24GB VRAM 可跑,目前 vLLM 支持,SGLang 暂不支持。Unsloth 的量化还带 Developer Role,可以接 Codex 这类 agent 工具;MTP 模块保留,推理速度更快;工具调用的嵌套解析也做了改进。
下载和运行:
- GGUF:https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
- Dynamic V3 说明:https://unsloth.ai/docs/basics/dynamic-3.0-ggufs
- 本地运行指南:https://unsloth.ai/docs/models/qwen3.8
Ollama 直接运行 ollama run hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M。llama.cpp 用 llama-cli -hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M。Unsloth Desktop 也内置了搜索下载和 Thinking 开关。
关注公众号回复“进群”入群讨论

