下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力:本仓库是DFlash 2推测解码框架中的草稿模型(draft model),不是独立语言模型,需要与Qwen3.8-27B目标模型搭配工作;通过块扩散一次性预测整块token并由轻量selector沿一条路径追踪,贪心输出与目标模型完全一致,采样保留目标分布;模型卡未说明其在对话、写作、工具调用等场景下的独立能力。量化仓库:基于incoai/Qwen3.8-27B-DFlash2,提供Q4_K_M、Q8_0、BF16三档GGUF量化,并镜像至z-lab同名仓库。运行工具:官方指定使用带DFlash 2支持的llama.cpp构建;tags标注支持llama.cpp,并被ollama和lmStudio运行时识别,但模型卡未说明后两者是否原生支持DFlash 2流程。
更适合谁
- 已部署Qwen3.8-27B目标模型并希望进一步提速的推理服务方
- 具备自行编译启用DFlash 2分支的llama.cpp能力的高级开发者
- 对块扩散与推测解码机制感兴趣的研究者
- 团队或服务端批量推理中希望降低单请求延迟的部署方
典型使用场景
- 在自建llama.cpp推测解码服务器中为Qwen3.8-27B目标模型起草候选token
- 与ggml-org/Qwen3.8-27B-GGUF(Q4_K_M)联合评估吞吐量与接受长度
- 在GSM8K前8条测试样例上对比Q4_K_M、Q8_0、BF16三档草稿表现
- 研究DFlash 2在不同采样参数与reasoning effort下的接受率
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
块扩散并行起草
一次性预测整块token并在每个位置保留top候选,再由轻量selector沿一条路径追踪
长块不衰减
骨干网络中的双tap动态卷积抑制草稿质量在块末段下滑
无损解码
贪心输出与目标模型完全一致,采样保留目标模型的概率分布
多档GGUF可选
Q4_K_M、Q8_0、BF16三档精度与显存占用覆盖不同部署条件
硬件怎么准备
- Q4_K_M:至少16GB内存或14GB显存,推荐19GB内存或16GB显存
- BF16:至少20GB内存或17GB显存,推荐24GB内存或19.5GB显存
- Q8_0:至少31.5GB内存或27.5GB显存,推荐38GB内存或31.5GB显存
- 草稿模型必须与Qwen3.8-27B目标模型同时加载,实际可用显存应以两者合计为准
量化版本怎么选
- Q4_K_M文件最小、显存门槛最低,且接受长度5.39在三档中最高,综合性价比突出
- BF16草稿保真度最高,接受长度5.28,适合显存充裕且追求稳定的部署
- Q8_0接受长度5.13居中,体积与显存占用介于Q4和BF16之间
- 三档接受长度差异较小,模型卡未提供端到端速度数据
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。
阅读 24GB 显存选型指南 →可以怎样运行
- 使用带DFlash 2支持的llama.cpp构建(PR #27342)并启动推测解码服务器
- 与ggml-org/Qwen3.8-27B-GGUF目标模型联合部署运行
- 通过官方博客与GitHub获取其他引擎与详细配置方法
- 模型卡未说明ollama或lmStudio能否原生运行该DFlash 2草稿流程
采用前要知道的限制
- 不是独立语言模型,无法单独用于对话、写作或通用文本生成
- 必须与Qwen3.8-27B目标模型配套运行,单独部署无效
- 需自行编译启用DFlash 2的llama.cpp,普通发行版不支持该流程
- 模型卡未给出端到端加速倍数与吞吐改善数据