下载量
0
参数
4B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力:Qwen3.8-4B-Distill 是一个 4B 参数推理型文本生成模型,由 Qwen3.8 2.4T A95B 教师模型经约 4.5 万条精选教师轨迹全参数蒸馏到 Qwen3.5-4B 架构而来,模型卡显示其在 MMLU CoT 等任务上较 Qwen3.5-4B 基座有显著提升,但 GSM8K 等任务略有下降;具体对话质量与最佳实践模型卡未说明,建议参考主模型卡。量化仓库:本仓库仅提供 GGUF 量化产物,覆盖 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 共五档,不含原始 PyTorch 权重。运行工具:原生适配 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等主流 GGUF 推理前端;上下文长度上限与训练数据构成模型卡未说明。
更适合谁
- 想在笔记本或入门级显卡上本地跑推理模型的用户
- 已部署较新 llama.cpp 或 Ollama 环境、愿意处理推理模型思考块输出的开发者
- 追求小显存占用同时希望获得推理增强能力的本地部署者
- 想低成本体验 Qwen3.5 混合稀疏注意力架构的爱好者
典型使用场景
- 消费级显卡或笔记本上的本地离线文本生成与问答
- 体验 Qwen3.5 混合架构在量化部署下的推理表现
- 作为更大模型蒸馏研究与基线对比的小体量参考对象
- 学习 GGUF 多档量化选型与本地推理前端配置
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
蒸馏推理增强
基于约 4.5 万条教师轨迹全参数蒸馏,模型卡显示 MMLU CoT 相对 Qwen3.5-4B 基座显著提升
混合稀疏注意力架构
继承 Qwen3.5 的 Gated DeltaNet 加全注意力混合结构,在效率与质量间取平衡
多档位量化覆盖
同时提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 五档,覆盖 4GB 至 12GB 以上显存区间
宽松开源协议
权重沿用 Apache-2.0,可自由分发与商用
主流 GGUF 运行时适配
直接支持 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等前端
硬件怎么准备
- Q4_K_M:约 4GB 内存或 2.5GB 显存即可加载,推荐 8GB 内存或 3.5GB 显存以获得更宽裕余量
- Q5_K_M:建议 6GB 以上显存,纯 CPU 需 8GB 左右内存
- Q6_K / Q8_0:分别需要约 3.5GB、4.5GB 以上显存,8GB 显卡可较舒适运行
- BF16:约 9GB 文件,建议 12GB 以上显存;长上下文时 KV 缓存会成为主要开销,可能需要显存卸载
量化版本怎么选
- 显存 4–6GB 或内存 8GB 首选 Q4_K_M,模型卡标注为推荐档,质量与体积平衡最佳
- 希望更贴近原精度可升至 Q5_K_M 或 Q6_K,文件体积仅小幅增加
- 想要参考级质量再考虑 Q8_0 或 BF16,其中 BF16 文件约 8.7GB,更接近无损
- 显存紧张时可先用 Q4_K_M 跑通,再视效果与硬件余量逐档上调
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。
阅读 4GB 显存选型指南 →可以怎样运行
- llama.cpp:使用内置 chat 模板并加 -cnv 参数,需选用支持 Qwen3.5 与 Gated DeltaNet 的较新构建
- Ollama、LM Studio、Jan、KoboldCpp:直接下载 GGUF 文件加载,使用文件内嵌 chat 模板
- 推荐采样参数 temperature=0.6、top_p=0.95、top_k=20
- 模型为推理模型,回答开头会出现思考块,需为 -n 预留充足输出长度,对外展示时可剥离该段
采用前要知道的限制
- 必须使用较新 llama.cpp 版本,老版本会因不支持 Qwen3.5 与 Gated DeltaNet 混合架构而加载失败
- 上下文长度上限模型卡未说明,长上下文场景下 KV 缓存开销需自行评估
- 完整基准、训练数据细节与最佳实践本卡未给出,需查阅主模型卡
- GSM8K 等任务上蒸馏版相对 Qwen3.5-4B 基座略有下降,纯通用问答场景可能弱于专门调优模型