← 返回模型库

z-lab/Qwen3.8-27B-DFlash2-GGUF

Qwen3.8-27B-DFlash2-GGUF:块扩散加速草稿模型

这是 Qwen3.8-27B 的 DFlash 2 推测解码草稿模型镜像,并非可独立运行的对话模型,必须搭配 Qwen3.8-27B 目标主模型在 llama.cpp 推测解码服务内使用,通过块扩散一次预测多个 token 提升生成速度。适合已在本地部署 Qwen3.

推测解码Qwen3.8加速草稿模型
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库由 z-lab 提供 GGUF 转换文件,能力来自 DFlash 2 草稿结构与基座 Qwen3.8-27B,标签明确为 gguf、dflash2、speculative-decoding、draft-model、llama.cpp,不属于独立对话模型。量化仓库覆盖 BF16、Q8_0、Q4_K_M 三档,README 列出文件从 1.1 GB 到 3.8 GB 不等。运行工具需使用带 DFlash 2 支持的 llama.cpp 构建(PR #27342),并搭配支持推测解码的服务端;模型卡未说明 Ollama 与 LM Studio 的独立运行方式,建议以官方构建为准。

更适合谁

  • 已在本地部署 Qwen3.8-27B 并希望降低首字延迟的推理用户
  • 愿意自行编译带 DFlash 2 支持的 llama.cpp 的技术用户
  • 关注吞吐与解码效率的本地推理服务搭建者

典型使用场景

  • 与 Qwen3.8-27B 目标主模型配对进行推测解码加速
  • 块扩散草稿在 GSM8K 等推理任务上的提速验证
  • 本地 llama.cpp 服务端低延迟生成场景
  • 模型卡未说明的独立对话或微调用途

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

块扩散一次预测整块 token 提升草稿吞吐

通过一次前向生成多个候选,再由轻量选择器拼出连贯路径

顶部候选全程保留避免草稿末端衰减

块末端使用双抽头动态卷积保持草稿质量

推测解码无损保证结果一致

贪心输出与目标模型完全一致,采样保持分布

多档量化覆盖不同硬件配置

提供 BF16、Q8_0、Q4_K_M 三种精度方便取舍

接受长度表现可观

Q4_K_M 接受长度 5.39 高于 BF16 与 Q8_0,覆盖更多生成 token

硬件怎么准备

  • Q4_K_M 草稿至少 16GB 内存或 14GB 显存,推荐 19GB 内存或 16GB 显存
  • BF16 草稿至少 20GB 内存或 17GB 显存,推荐 24GB 内存或 19.5GB 显存
  • Q8_0 草稿至少 31.5GB 内存或 27.5GB 显存,推荐 38GB 内存或 31.5GB 显存
  • 上述仅为草稿本体估算,目标主模型 Qwen3.8-27B 仍需独立硬件预算

量化版本怎么选

  • Q4_K_M 文件最小且接受长度 5.39 略高,是显存紧张时的首选
  • BF16 与 Q8_0 接受长度分别为 5.28 和 5.13,速度差异模型卡未说明
  • 草稿模型不直接决定生成质量,建议按硬件容量选档,不追求极致精度

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q413 GB14 GB16 GB19 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp 推测解码服务端,需使用带 DFlash 2 支持的构建(PR #27342)
  • Ollama 与 LM Studio 仅作为文件分发渠道,独立运行效果模型卡未说明
  • 草稿与目标模型需在同一服务内联用,不能单独调用完成对话

采用前要知道的限制

  • 不是独立对话模型,必须搭配 Qwen3.8-27B 目标主模型使用
  • 需自行编译支持 DFlash 2 的 llama.cpp,普通构建无法启用
  • RAM/VRAM 估算与 README 文件体积口径不同,实际占用以本地实测为准
  • 模型卡未给出具体推理速度提升幅度与采样参数之外的表现