大数跨境

Qwen3.8-27B 量化新版本:1-bit 只要 8GB 内存,精度保留 77%

Qwen3.8-27B 量化新版本:1-bit 只要 8GB 内存,精度保留 77% AI工程化
2026-08-20
2

Unsloth 今天给 Qwen3.8-27B 的 GGUF 做了一次重要升级。新版本用上 Dynamic V3 量化,官方给出的对比是:同样文件大小下,Top-1% 准确率比其他量化方案高 10% 以上。最激进的 1-bit 版本能把模型压到 6.2GB,保留 77% 的准确率,8GB 内存就能跑。

Qwen3.8-27B 是 Qwen 开源家族的最新成员。27B 参数,稠密架构,原生支持图片和视频理解,上下文 262K,可扩展到 1M。Unsloth 称其为同尺寸最强模型。BF16 原始权重需要 54.7GB,所以量化是把模型塞进普通设备的关键。

Dynamic V3 是 Unsloth 自研量化方法的第三次迭代。它换了更高品质的 imatrix 校准数据集,重新设计了层选择策略,并且没有用 QAT 或 QAD,纯靠训练后量化。Unsloth 用 300 条未参与校准的样本做 Divergence-300 测试,对比量化模型和 BF16 在 32 个 token 输出轨迹上的重合度,用来排除过拟合。KLD 结果同样显示,同尺寸下 UD-3 比其他家表现更好。

硬件需求如下,单位是 RAM 加 VRAM 的总量:

量化 内存
1-bit 7-8 GB
2-bit 9-11 GB
3-bit 12-14 GB
4-bit 16-19 GB
6-bit 23-26 GB
8-bit 31 GB
BF16 56 GB

4-bit 版本 17GB 左右就能跑,24GB 显卡或 32GB 内存的笔记本都带得动。1-bit 版把门槛压到 8GB,适合先体验,不适合当主力。

除了 GGUF,Unsloth 还更新了 NVFP4 量化。Blackwell GPU 上比 BF16 快约 1.5 倍,24GB VRAM 可跑,目前 vLLM 支持,SGLang 暂不支持。Unsloth 的量化还带 Developer Role,可以接 Codex 这类 agent 工具;MTP 模块保留,推理速度更快;工具调用的嵌套解析也做了改进。

下载和运行:

  • GGUF:https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
  • Dynamic V3 说明:https://unsloth.ai/docs/basics/dynamic-3.0-ggufs
  • 本地运行指南:https://unsloth.ai/docs/models/qwen3.8

Ollama 直接运行 ollama run hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M。llama.cpp 用 llama-cli -hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_M。Unsloth Desktop 也内置了搜索下载和 Thinking 开关。

关注公众号回复“进群”入群讨论

【声明】内容源于网络
0
0
AI工程化
专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
内容 633
粉丝 0
AI工程化 专注于AI领域(大模型、MLOPS/LLMOPS 、AI应用开发、AI infra)前沿产品技术信息和实践经验分享。
总阅读4.3k
粉丝0
内容633