← 返回模型库

empero-ai/Qwen3.8-4B-Distill-GGUF

Qwen3.8-4B-Distill-GGUF:4B 蒸馏推理模型量化包

Qwen3.8-4B-Distill 是把 Qwen3.8 2.4T A95B 大模型蒸馏到 Qwen3.5-4B 架构而来的 4B 参数推理模型,本仓库为 GGUF 量化版。适合想在消费级硬件上本地跑推理模型、又不愿承担大模型显存开销的用户。属于 Qwen3.

4B 蒸馏推理GGUF 量化本地部署Qwen3.5 混合架构
查看模型源页面
下载量
0
参数
4B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力:Qwen3.8-4B-Distill 是一个 4B 参数推理型文本生成模型,由 Qwen3.8 2.4T A95B 教师模型经约 4.5 万条精选教师轨迹全参数蒸馏到 Qwen3.5-4B 架构而来,模型卡显示其在 MMLU CoT 等任务上较 Qwen3.5-4B 基座有显著提升,但 GSM8K 等任务略有下降;具体对话质量与最佳实践模型卡未说明,建议参考主模型卡。量化仓库:本仓库仅提供 GGUF 量化产物,覆盖 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 共五档,不含原始 PyTorch 权重。运行工具:原生适配 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等主流 GGUF 推理前端;上下文长度上限与训练数据构成模型卡未说明。

更适合谁

  • 想在笔记本或入门级显卡上本地跑推理模型的用户
  • 已部署较新 llama.cpp 或 Ollama 环境、愿意处理推理模型思考块输出的开发者
  • 追求小显存占用同时希望获得推理增强能力的本地部署者
  • 想低成本体验 Qwen3.5 混合稀疏注意力架构的爱好者

典型使用场景

  • 消费级显卡或笔记本上的本地离线文本生成与问答
  • 体验 Qwen3.5 混合架构在量化部署下的推理表现
  • 作为更大模型蒸馏研究与基线对比的小体量参考对象
  • 学习 GGUF 多档量化选型与本地推理前端配置

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

蒸馏推理增强

基于约 4.5 万条教师轨迹全参数蒸馏,模型卡显示 MMLU CoT 相对 Qwen3.5-4B 基座显著提升

混合稀疏注意力架构

继承 Qwen3.5 的 Gated DeltaNet 加全注意力混合结构,在效率与质量间取平衡

多档位量化覆盖

同时提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 五档,覆盖 4GB 至 12GB 以上显存区间

宽松开源协议

权重沿用 Apache-2.0,可自由分发与商用

主流 GGUF 运行时适配

直接支持 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等前端

硬件怎么准备

  • Q4_K_M:约 4GB 内存或 2.5GB 显存即可加载,推荐 8GB 内存或 3.5GB 显存以获得更宽裕余量
  • Q5_K_M:建议 6GB 以上显存,纯 CPU 需 8GB 左右内存
  • Q6_K / Q8_0:分别需要约 3.5GB、4.5GB 以上显存,8GB 显卡可较舒适运行
  • BF16:约 9GB 文件,建议 12GB 以上显存;长上下文时 KV 缓存会成为主要开销,可能需要显存卸载

量化版本怎么选

  • 显存 4–6GB 或内存 8GB 首选 Q4_K_M,模型卡标注为推荐档,质量与体积平衡最佳
  • 希望更贴近原精度可升至 Q5_K_M 或 Q6_K,文件体积仅小幅增加
  • 想要参考级质量再考虑 Q8_0 或 BF16,其中 BF16 文件约 8.7GB,更接近无损
  • 显存紧张时可先用 Q4_K_M 跑通,再视效果与硬件余量逐档上调

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q41.9 GB2.5 GB3.5 GB8 GB文件 ↗
BF162.3 GB3 GB4 GB8 GB文件 ↗
Q52.3 GB3 GB4 GB8 GB文件 ↗
Q62.8 GB3.5 GB4.5 GB8 GB文件 ↗
Q83.7 GB4.5 GB5.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • llama.cpp:使用内置 chat 模板并加 -cnv 参数,需选用支持 Qwen3.5 与 Gated DeltaNet 的较新构建
  • Ollama、LM Studio、Jan、KoboldCpp:直接下载 GGUF 文件加载,使用文件内嵌 chat 模板
  • 推荐采样参数 temperature=0.6、top_p=0.95、top_k=20
  • 模型为推理模型,回答开头会出现思考块,需为 -n 预留充足输出长度,对外展示时可剥离该段

采用前要知道的限制

  • 必须使用较新 llama.cpp 版本,老版本会因不支持 Qwen3.5 与 Gated DeltaNet 混合架构而加载失败
  • 上下文长度上限模型卡未说明,长上下文场景下 KV 缓存开销需自行评估
  • 完整基准、训练数据细节与最佳实践本卡未给出,需查阅主模型卡
  • GSM8K 等任务上蒸馏版相对 Qwen3.5-4B 基座略有下降,纯通用问答场景可能弱于专门调优模型