下载量
0
参数
2B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来源:模型卡与标签显示原始权重为基于 Qwen3.8 的全参蒸馏学生模型,pipeline_tag 为 text-generation,标签含 reasoning、gated-deltanet、edge;其采用 Qwen3.5 混合层架构(每三层 Gated DeltaNet 加一层全注意力),并注明回答会以思考块开头,作者把具体榜单对比与最佳实践指向主模型卡。量化仓库:仅提供 GGUF 格式,覆盖 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 共 5 档,README 标注了精确文件大小。运行工具:作者明示支持 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等主流 GGUF 运行时。
更适合谁
- 想在手机或单板机上离线体验推理模型的极轻量用户
- 配备 4–8 GB 内存或入门独显的笔记本与迷你主机用户
- 需要 Apache-2.0 商用许可、本地私有化部署 2B 文本生成的开发者
- 想测试 Qwen3.5 混合架构与 Gated DeltaNet 推理栈的尝鲜者
典型使用场景
- 离线问答与中英文短文本生成、草稿润色
- 在手机、迷你主机、轻薄本上验证本地推理体验
- 受规模限制的轻量级链式思考与数学思路演练
- 作为下游指令微调或能力评测的轻量基座
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
蒸馏推理定位
以 2B 体积从更大教师模型蒸馏而来,模型卡展示 mmlu、gsm8k_cot 等相对基底的明显提升
边缘可跑
源卡明确把 Q4_K_M 列为可在手机、单板机运行的推荐档,CPU-only 完全可用
混合架构特性
沿用 Qwen3.5 的 Gated DeltaNet 与全注意力混合层,关注长上下文 KV 缓存表现
多档位量化选择
一档覆盖 Q4 到 BF16 五种精度,便于按显存和硬盘空间权衡
标准 GGUF 生态兼容
适配 Ollama、LM Studio、Jan、KoboldCpp 等常见前端,无需额外转换
硬件怎么准备
- Q4_K_M、Q5_K_M:源卡定位为手机、单板机与现代笔记本均可运行,CPU 即可;估算内存 4 GB 起步,建议预留 8 GB
- Q6_K:源卡建议任意 4 GB 以上 GPU 或 8 GB 内存 CPU;估算显存约 2 GB、内存建议 8 GB
- Q8_0:源卡建议任意 4 GB 以上 GPU 或 8 GB 内存 CPU;估算显存约 2.5 GB、内存建议 8 GB
- BF16:源卡建议 6 GB 以上显存,README 标注文件约 3.9 GB,需为 KV 缓存留出余量
量化版本怎么选
- 随身设备首选 Q4_K_M,作者明确标注为推荐档,强调质量与体积最佳折中
- 希望更高回答质量且不在意略增体积,可升至 Q5_K_M 或 Q6_K(后者标为接近无损)
- Q8_0 适合追求接近无损且显存较宽裕的本地体验
- BF16 仅在需要作为参考精度或再训练、再量化场景选用
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 1.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2.5GB。
阅读 4GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载:使用内置 chat 模板并加 -cnv,注意留出足够 -n 并处理思考块
- Ollama、LM Studio、Jan:选择对应 GGUF 文件直接加载,模板已嵌入
- KoboldCpp:按通用 GGUF 流程加载
- 采样参数:源卡建议 temperature=0.6、top_p=0.95、top_k=20
采用前要知道的限制
- 模型卡未提供上下文长度数值,长文本受 KV 缓存主导的显存与内存约束
- 元数据语言标注仅有 en,模型卡未说明中文训练覆盖程度
- 需要支持 Gated DeltaNet 的较新 llama.cpp 构建,老版本会加载失败
- 2B 参数规模决定复杂推理与事实准确性的上限,重任务需更大模型