下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自上游 empero-ai/Qwen3.8-9B,是基于 Qwen3.5-9B 架构的推理型蒸馏模型,强调思维链输出,原模型卡说明在 MMLU 57 科目上较 Qwen3.5-9B 基座有明显提升。仓库本身仅承担量化分发与多 GGUF 文件维护职责,并不重新训练模型。运行工具方面,README 明确要求较新的 llama.cpp,需支持 Qwen3.5 与 Gated DeltaNet,同时声明兼容 Ollama、LM Studio、Jan、KoboldCpp 等主流 GGUF 客户端。模型卡未给出详细训练数据组成与官方推荐应用场景。
更适合谁
- 拥有 8 GB 至 16 GB 显存显卡、想本地跑 Qwen3.8 系列推理风格的玩家
- 习惯使用 Ollama、LM Studio、KoboldCpp 等 GGUF 客户端的个人开发者
- 研究 Gated DeltaNet 混合架构与蒸馏效果的技术爱好者
- 需要在消费级硬件上做思维链推理实验的中文与英文使用者
典型使用场景
- 本地思维链问答、数学与逻辑推理对话
- 离线文本生成与写作辅助
- 研究 Qwen3.5 混合架构在消费级硬件上的推理表现
- 作为研究 Qwen3.8 蒸馏路径的对比基座
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
9B 蒸馏推理
将 Qwen3.8 2.4T A95B 教师能力压缩到 Qwen3.5-9B 规模,保留思维链推理风格
混合架构模型
基于 Qwen3.5-9B,三层 Gated DeltaNet 配合一层全注意力层
多档位 GGUF
提供 Q4_K_M 至 BF16 五种量化,覆盖从 8 GB 到 24 GB 以上显卡
推荐参数明确
官方推荐 temperature=0.6、top_p=0.95、top_k=20 的采样设置
硬件怎么准备
- 8 GB 至 12 GB 显存显卡:可选 Q4_K_M 或 Q5_K_M,适合日常短上下文使用
- 12 GB 至 16 GB 显存:可使用 Q6_K 或 Q8_0,获得更高质量
- 24 GB 及以上显存或纯 CPU:可加载 BF16 全精度参考文件
- 长上下文场景需额外预留显存用于 KV 缓存,可能需要部分卸载
量化版本怎么选
- Q4_K_M 5.780 GB:官方推荐,兼顾体积与质量,适合多数用户
- Q5_K_M 6.643 GB:质量更高,在 8 GB 显卡短上下文下仍可运行
- Q6_K 7.559 GB:接近无损,是质量与体积的折中点
- BF16 18.407 GB:仅供全精度研究与对比,不适合普通消费级显卡
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp:使用内置 chat 模板 -cnv,需较新版本以支持 Qwen3.5 与 Gated DeltaNet
- Ollama:直接加载 GGUF 文件,使用嵌入的聊天模板
- LM Studio、Jan、KoboldCpp:下载 GGUF 后直接加载即可
采用前要知道的限制
- 仓库仅提供量化文件,能力上限取决于上游 empero-ai/Qwen3.8-9B
- 必须使用支持 Qwen3.5 与 Gated DeltaNet 的较新 llama.cpp,否则无法加载
- 模型卡未说明完整训练数据细节与官方推荐应用场景
- 推理输出默认含思维链块,需在客户端做相应处理才能给最终用户使用