← 返回模型库

empero-ai/Qwen3.8-9B-Distill-GGUF

Qwen3.8-9B-Distill-GGUF:蒸馏9B推理模型的GGUF量化版

基于 Qwen3.5-9B 架构蒸馏自 Qwen3.8 教师模型,主打推理能力,MMLU 提升明显。提供 Q4 到 BF16 多档 GGUF 量化,9B 参数量适合消费级显卡和笔记本本地运行。注意这是 Gated DeltaNet 混合架构,需使用较新的 llama.cpp(支持 Qwen3.

本地推理模型GGUF 量化9B 蒸馏模型思维链
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

该仓库是 empero-ai/Qwen3.8-9B 的 GGUF 量化分发,模型能力描述以源模型卡与标签为准;本卡主要说明文件选择与运行方式,未单独给出完整能力白皮书,基准细节与最佳实践见主模型卡。标签含 reasoning、distillation、gated-deltanet,定位为文本生成与推理任务。提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 共 5 档文件,覆盖从轻量到无损的不同显存预算。运行工具覆盖 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等主流 GGUF 运行时。模型卡未说明上下文长度上限,也未列出训练数据规模与多语言覆盖细节。

更适合谁

  • 想在消费级硬件跑推理模型的本地用户
  • 拥有 8GB 以上显存或内存的玩家
  • 习惯用 Ollama、LM Studio 或 llama.cpp 的部署者

典型使用场景

  • 本地离线推理问答与文本生成
  • 需要可见思维链的数学推导与编程解题
  • 中英文混合的对话与写作辅助
  • 资源受限设备的模型能力对比测试

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

MMLU 蒸馏增益显著

在 MMLU(CoT,57 科目)上由基础 0.546 提升到 0.751

9B 轻量推理底座

基于 Qwen3.5-9B 架构做全参数蒸馏,参数量适中

混合注意力结构

三层 Gated DeltaNet 加一层全注意力的 Qwen3.5 类设计

内置思维链输出

每次回答以思考块开头,便于解析推理过程

多档 GGUF 量化覆盖

从 Q4 到 BF16 五个精度档满足不同显存预算

硬件怎么准备

  • Q4_K_M 最低约 5.5GB 内存或 5GB 显存,推荐 8GB 内存或 6GB 显存
  • Q5_K_M 最低约 7GB 内存或 6GB 显存,推荐 8GB 内存或 7GB 显存
  • Q6_K 与 Q8_0 建议 12–16GB 显存的显卡
  • BF16 需要 24GB 以上显存,长上下文还需额外 KV 缓存开销

量化版本怎么选

  • 日常使用推荐 Q4_K_M,质量与体积最均衡
  • 显存充裕想再提质量可选 Q5_K_M 或 Q6_K
  • 需要接近无损的对比场景选 Q8_0
  • BF16 仅用于完整精度参考,不适合普通本地部署

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q44.2 GB5 GB6 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载并使用内置对话模板
  • Ollama、LM Studio、Jan、KoboldCpp 直接拖入 GGUF 即可使用
  • 推荐采样参数 temperature=0.6, top_p=0.95, top_k=20
  • 调用时给足 -n 输出长度,并剥离思考块后再呈现给终端用户

采用前要知道的限制

  • 需较新 llama.cpp,旧版不支持 Qwen3.5 / Gated DeltaNet 会加载失败
  • 每次回答开头的思考块会占用输出 token,注意截断与解析
  • GSM8K 相比基础模型略有下降(0.885 → 0.870)
  • 模型卡未说明上下文长度与训练数据规模细节