下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库由 z-lab 提供 GGUF 转换文件,能力来自 DFlash 2 草稿结构与基座 Qwen3.8-27B,标签明确为 gguf、dflash2、speculative-decoding、draft-model、llama.cpp,不属于独立对话模型。量化仓库覆盖 BF16、Q8_0、Q4_K_M 三档,README 列出文件从 1.1 GB 到 3.8 GB 不等。运行工具需使用带 DFlash 2 支持的 llama.cpp 构建(PR #27342),并搭配支持推测解码的服务端;模型卡未说明 Ollama 与 LM Studio 的独立运行方式,建议以官方构建为准。
更适合谁
- 已在本地部署 Qwen3.8-27B 并希望降低首字延迟的推理用户
- 愿意自行编译带 DFlash 2 支持的 llama.cpp 的技术用户
- 关注吞吐与解码效率的本地推理服务搭建者
典型使用场景
- 与 Qwen3.8-27B 目标主模型配对进行推测解码加速
- 块扩散草稿在 GSM8K 等推理任务上的提速验证
- 本地 llama.cpp 服务端低延迟生成场景
- 模型卡未说明的独立对话或微调用途
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
块扩散一次预测整块 token 提升草稿吞吐
通过一次前向生成多个候选,再由轻量选择器拼出连贯路径
顶部候选全程保留避免草稿末端衰减
块末端使用双抽头动态卷积保持草稿质量
推测解码无损保证结果一致
贪心输出与目标模型完全一致,采样保持分布
多档量化覆盖不同硬件配置
提供 BF16、Q8_0、Q4_K_M 三种精度方便取舍
接受长度表现可观
Q4_K_M 接受长度 5.39 高于 BF16 与 Q8_0,覆盖更多生成 token
硬件怎么准备
- Q4_K_M 草稿至少 16GB 内存或 14GB 显存,推荐 19GB 内存或 16GB 显存
- BF16 草稿至少 20GB 内存或 17GB 显存,推荐 24GB 内存或 19.5GB 显存
- Q8_0 草稿至少 31.5GB 内存或 27.5GB 显存,推荐 38GB 内存或 31.5GB 显存
- 上述仅为草稿本体估算,目标主模型 Qwen3.8-27B 仍需独立硬件预算
量化版本怎么选
- Q4_K_M 文件最小且接受长度 5.39 略高,是显存紧张时的首选
- BF16 与 Q8_0 接受长度分别为 5.28 和 5.13,速度差异模型卡未说明
- 草稿模型不直接决定生成质量,建议按硬件容量选档,不追求极致精度
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp 推测解码服务端,需使用带 DFlash 2 支持的构建(PR #27342)
- Ollama 与 LM Studio 仅作为文件分发渠道,独立运行效果模型卡未说明
- 草稿与目标模型需在同一服务内联用,不能单独调用完成对话
采用前要知道的限制
- 不是独立对话模型,必须搭配 Qwen3.8-27B 目标主模型使用
- 需自行编译支持 DFlash 2 的 llama.cpp,普通构建无法启用
- RAM/VRAM 估算与 README 文件体积口径不同,实际占用以本地实测为准
- 模型卡未给出具体推理速度提升幅度与采样参数之外的表现