← 返回模型库

empero-ai/Qwen3.8-2B-Distill-GGUF

Qwen3.8-2B-Distill-GGUF:手机可跑的 2B 蒸馏推理量化版

该仓库是 empero-ai/Qwen3.8-2B 的官方 GGUF 量化合集,对应 2B 参数的蒸馏推理模型,主打文本生成与思考型回答。适合想在手机、单板机、轻薄本上离线运行轻量对话的中文及英文用户,CPU 即可起步。Q4 量化约 1.3 GB,本地门槛低。注意需较新 llama.cpp 以支持 Qwen3.

边缘推理轻量聊天GGUF 量化本地部署
查看模型源页面
下载量
0
参数
2B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来源:模型卡与标签显示原始权重为基于 Qwen3.8 的全参蒸馏学生模型,pipeline_tag 为 text-generation,标签含 reasoning、gated-deltanet、edge;其采用 Qwen3.5 混合层架构(每三层 Gated DeltaNet 加一层全注意力),并注明回答会以思考块开头,作者把具体榜单对比与最佳实践指向主模型卡。量化仓库:仅提供 GGUF 格式,覆盖 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 共 5 档,README 标注了精确文件大小。运行工具:作者明示支持 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等主流 GGUF 运行时。

更适合谁

  • 想在手机或单板机上离线体验推理模型的极轻量用户
  • 配备 4–8 GB 内存或入门独显的笔记本与迷你主机用户
  • 需要 Apache-2.0 商用许可、本地私有化部署 2B 文本生成的开发者
  • 想测试 Qwen3.5 混合架构与 Gated DeltaNet 推理栈的尝鲜者

典型使用场景

  • 离线问答与中英文短文本生成、草稿润色
  • 在手机、迷你主机、轻薄本上验证本地推理体验
  • 受规模限制的轻量级链式思考与数学思路演练
  • 作为下游指令微调或能力评测的轻量基座

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

蒸馏推理定位

以 2B 体积从更大教师模型蒸馏而来,模型卡展示 mmlu、gsm8k_cot 等相对基底的明显提升

边缘可跑

源卡明确把 Q4_K_M 列为可在手机、单板机运行的推荐档,CPU-only 完全可用

混合架构特性

沿用 Qwen3.5 的 Gated DeltaNet 与全注意力混合层,关注长上下文 KV 缓存表现

多档位量化选择

一档覆盖 Q4 到 BF16 五种精度,便于按显存和硬盘空间权衡

标准 GGUF 生态兼容

适配 Ollama、LM Studio、Jan、KoboldCpp 等常见前端,无需额外转换

硬件怎么准备

  • Q4_K_M、Q5_K_M:源卡定位为手机、单板机与现代笔记本均可运行,CPU 即可;估算内存 4 GB 起步,建议预留 8 GB
  • Q6_K:源卡建议任意 4 GB 以上 GPU 或 8 GB 内存 CPU;估算显存约 2 GB、内存建议 8 GB
  • Q8_0:源卡建议任意 4 GB 以上 GPU 或 8 GB 内存 CPU;估算显存约 2.5 GB、内存建议 8 GB
  • BF16:源卡建议 6 GB 以上显存,README 标注文件约 3.9 GB,需为 KV 缓存留出余量

量化版本怎么选

  • 随身设备首选 Q4_K_M,作者明确标注为推荐档,强调质量与体积最佳折中
  • 希望更高回答质量且不在意略增体积,可升至 Q5_K_M 或 Q6_K(后者标为接近无损)
  • Q8_0 适合追求接近无损且显存较宽裕的本地体验
  • BF16 仅在需要作为参考精度或再训练、再量化场景选用

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q40.9 GB1.5 GB2.5 GB8 GB文件 ↗
BF161.2 GB1.5 GB2.5 GB8 GB文件 ↗
Q51.2 GB1.5 GB2.5 GB8 GB文件 ↗
Q61.4 GB2 GB3 GB8 GB文件 ↗
Q81.9 GB2.5 GB3.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2.5GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载:使用内置 chat 模板并加 -cnv,注意留出足够 -n 并处理思考块
  • Ollama、LM Studio、Jan:选择对应 GGUF 文件直接加载,模板已嵌入
  • KoboldCpp:按通用 GGUF 流程加载
  • 采样参数:源卡建议 temperature=0.6、top_p=0.95、top_k=20

采用前要知道的限制

  • 模型卡未提供上下文长度数值,长文本受 KV 缓存主导的显存与内存约束
  • 元数据语言标注仅有 en,模型卡未说明中文训练覆盖程度
  • 需要支持 Gated DeltaNet 的较新 llama.cpp 构建,老版本会加载失败
  • 2B 参数规模决定复杂推理与事实准确性的上限,重任务需更大模型