下载量
0
参数
14B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
三层定位。能力层:作为剪枝后用 Claude Fable 5 推理链重新 QLoRA 蒸馏的 14B MoE 模型,模型卡说明属于通用推理模型,会先输出 Qwen 思考 token 再作答,覆盖写作、代码、工具调用等多步任务,并附带 mmproj 文件支持视觉输入。量化仓库层:本仓库仅发布 GGUF 量化,从 Q2_K 到 Q8_0 共八种配置,便于在不同显存条件下取舍。运行工具层:依赖 llama.cpp 兼容后端,Ollama、LM Studio 与 text-generation-webui 均支持。模型卡未提供推理速度与基准成绩。
更适合谁
- 想要消费级显存跑多步推理的中文用户
- 想复现 Claude Fable 5 风格结构化思考链的玩家
- 同时需要写作、编程与工具调用的小型本地工作流开发者
- 在 8GB 至 16GB 显存之间反复横跳挑量化的本地部署者
典型使用场景
- 多步中文写作与结构化规划
- 编程辅助与代码改写
- 视觉问答与图文混合推理
- 函数调用或本地 Agent 草稿生成
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
长思维链
沿用 Qwen 思考模式,先吐推理 token 再给出最终答复
多模态支持
仓库自带 mmproj-F16 文件,可接入视觉问答
工具调用混合训练
训练数据混入 Qwen 工具调用与 Opus 推理痕迹
代码与多步规划
引入 Evol-Instruct-Code 强化代码生成与多步任务
量化谱覆盖宽
从 Q2_K 到 Q8_0 覆盖消费级到近无损区间
硬件怎么准备
- 显存 8GB 以下建议选 Q2_K 或 Q3_K_M
- 显存 8GB 到 12GB 推荐 Q4_K_M
- 显存 12GB 到 16GB 可尝试 Q5_K_M 或 BPW4.75
- 显存 16GB 以上考虑 Q6_K 或 Q8_0
量化版本怎么选
- 想要损失最小优先 Q8_0 或 Q6_K
- 想要质量与体积平衡选 Q5_K_M 或 BPW4.75
- 显存紧张先以 Q4_K_M 作为基本盘
- 极致压缩场景再考虑 Q3_K_M 或 Q2_K
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 4GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载 GGUF 文件
- Ollama 通过模型标识拉取并运行
- LM Studio 选择本地 GGUF 启动
- text-generation-webui 通过 llama.cpp 后端调用
采用前要知道的限制
- 首 token 时延受长思考链影响会显著拉长
- 剪枝后未做预微调,部分能力依赖 Fable LoRA 补回
- 模型卡未提供速度与质量基准,无法估算实际吞吐
- 仓库内 F16 文件仅是 mmproj 视觉投影,并非完整主模型量化