← 返回模型库

tvall43/Qwen3.6-14B-A3B-FableVibes-GGUF

Qwen3.6-14B-A3B-FableVibes-GGUF:14B推理蒸馏的消费级长思维模型

Qwen3.6-14B-A3B-FableVibes 由 Qwen3.6-35B-A3B 经 REAP 剪枝到 14B 活跃参数,再用 Claude Fable 5 推理痕迹做 QLoRA 蒸馏得到。回答前会输出思考 token,适合中文写作、编程与多步规划。Q3_K_M 至 Q4_K_M 即可在消费级显存上跑通。

通用推理长思维链多模态
查看模型源页面
下载量
0
参数
14B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

三层定位。能力层:作为剪枝后用 Claude Fable 5 推理链重新 QLoRA 蒸馏的 14B MoE 模型,模型卡说明属于通用推理模型,会先输出 Qwen 思考 token 再作答,覆盖写作、代码、工具调用等多步任务,并附带 mmproj 文件支持视觉输入。量化仓库层:本仓库仅发布 GGUF 量化,从 Q2_K 到 Q8_0 共八种配置,便于在不同显存条件下取舍。运行工具层:依赖 llama.cpp 兼容后端,Ollama、LM Studio 与 text-generation-webui 均支持。模型卡未提供推理速度与基准成绩。

更适合谁

  • 想要消费级显存跑多步推理的中文用户
  • 想复现 Claude Fable 5 风格结构化思考链的玩家
  • 同时需要写作、编程与工具调用的小型本地工作流开发者
  • 在 8GB 至 16GB 显存之间反复横跳挑量化的本地部署者

典型使用场景

  • 多步中文写作与结构化规划
  • 编程辅助与代码改写
  • 视觉问答与图文混合推理
  • 函数调用或本地 Agent 草稿生成

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

长思维链

沿用 Qwen 思考模式,先吐推理 token 再给出最终答复

多模态支持

仓库自带 mmproj-F16 文件,可接入视觉问答

工具调用混合训练

训练数据混入 Qwen 工具调用与 Opus 推理痕迹

代码与多步规划

引入 Evol-Instruct-Code 强化代码生成与多步任务

量化谱覆盖宽

从 Q2_K 到 Q8_0 覆盖消费级到近无损区间

硬件怎么准备

  • 显存 8GB 以下建议选 Q2_K 或 Q3_K_M
  • 显存 8GB 到 12GB 推荐 Q4_K_M
  • 显存 12GB 到 16GB 可尝试 Q5_K_M 或 BPW4.75
  • 显存 16GB 以上考虑 Q6_K 或 Q8_0

量化版本怎么选

  • 想要损失最小优先 Q8_0 或 Q6_K
  • 想要质量与体积平衡选 Q5_K_M 或 BPW4.75
  • 显存紧张先以 Q4_K_M 作为基本盘
  • 极致压缩场景再考虑 Q3_K_M 或 Q2_K

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q23.3 GB4 GB5 GB8 GB文件 ↗
Q34.9 GB5.5 GB6.5 GB8 GB文件 ↗
Q46.5 GB7.5 GB8.5 GB10 GB文件 ↗
GGUF8.1 GB9 GB10.5 GB12.5 GB文件 ↗
Q58.1 GB9 GB10.5 GB12.5 GB文件 ↗
F168.1 GB9 GB10.5 GB12.5 GB文件 ↗
Q69.8 GB11 GB12.5 GB15 GB文件 ↗
Q813 GB14.5 GB16.5 GB20 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 4GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载 GGUF 文件
  • Ollama 通过模型标识拉取并运行
  • LM Studio 选择本地 GGUF 启动
  • text-generation-webui 通过 llama.cpp 后端调用

采用前要知道的限制

  • 首 token 时延受长思考链影响会显著拉长
  • 剪枝后未做预微调,部分能力依赖 Fable LoRA 补回
  • 模型卡未提供速度与质量基准,无法估算实际吞吐
  • 仓库内 F16 文件仅是 mmproj 视觉投影,并非完整主模型量化