下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
该仓库是 empero-ai/Qwen3.8-9B 的 GGUF 量化分发,模型能力描述以源模型卡与标签为准;本卡主要说明文件选择与运行方式,未单独给出完整能力白皮书,基准细节与最佳实践见主模型卡。标签含 reasoning、distillation、gated-deltanet,定位为文本生成与推理任务。提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 共 5 档文件,覆盖从轻量到无损的不同显存预算。运行工具覆盖 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等主流 GGUF 运行时。模型卡未说明上下文长度上限,也未列出训练数据规模与多语言覆盖细节。
更适合谁
- 想在消费级硬件跑推理模型的本地用户
- 拥有 8GB 以上显存或内存的玩家
- 习惯用 Ollama、LM Studio 或 llama.cpp 的部署者
典型使用场景
- 本地离线推理问答与文本生成
- 需要可见思维链的数学推导与编程解题
- 中英文混合的对话与写作辅助
- 资源受限设备的模型能力对比测试
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
MMLU 蒸馏增益显著
在 MMLU(CoT,57 科目)上由基础 0.546 提升到 0.751
9B 轻量推理底座
基于 Qwen3.5-9B 架构做全参数蒸馏,参数量适中
混合注意力结构
三层 Gated DeltaNet 加一层全注意力的 Qwen3.5 类设计
内置思维链输出
每次回答以思考块开头,便于解析推理过程
多档 GGUF 量化覆盖
从 Q4 到 BF16 五个精度档满足不同显存预算
硬件怎么准备
- Q4_K_M 最低约 5.5GB 内存或 5GB 显存,推荐 8GB 内存或 6GB 显存
- Q5_K_M 最低约 7GB 内存或 6GB 显存,推荐 8GB 内存或 7GB 显存
- Q6_K 与 Q8_0 建议 12–16GB 显存的显卡
- BF16 需要 24GB 以上显存,长上下文还需额外 KV 缓存开销
量化版本怎么选
- 日常使用推荐 Q4_K_M,质量与体积最均衡
- 显存充裕想再提质量可选 Q5_K_M 或 Q6_K
- 需要接近无损的对比场景选 Q8_0
- BF16 仅用于完整精度参考,不适合普通本地部署
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载并使用内置对话模板
- Ollama、LM Studio、Jan、KoboldCpp 直接拖入 GGUF 即可使用
- 推荐采样参数 temperature=0.6, top_p=0.95, top_k=20
- 调用时给足 -n 输出长度,并剥离思考块后再呈现给终端用户
采用前要知道的限制
- 需较新 llama.cpp,旧版不支持 Qwen3.5 / Gated DeltaNet 会加载失败
- 每次回答开头的思考块会占用输出 token,注意截断与解析
- GSM8K 相比基础模型略有下降(0.885 → 0.870)
- 模型卡未说明上下文长度与训练数据规模细节