DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:去审查强化推理全能型
基于Qwen3.6-27B多阶段微调并经Heretic去审查,强化思考推理、指令跟随与通用能力,支持视觉与长上下文。27B体量对显存门槛较高,Q4量约需16GB显存、Q8需30GB以上,适合中文高级用户与本地推理爱好者使用MTP可进一步提速。
MODEL POSITIONING
这个模型解决什么问题?
本仓库为GGUF量化版本,提供常规与MTP多token预测两套NEO IMATRIX量化,覆盖IQ2到Q8共十余种规格,并含LOW与AMD/VULKAN特殊变体与mmproj视觉投影文件。模型卡未公开Q4_K_M等具体绝对速度数字。原模型Qwen3.6-27B由Qwen团队发布,主打Agent编码、推理、长上下文与视觉能力;本微调重点强化指令跟随与问题求解,并经Heretic去除拒绝倾向。运行工具支持Ollama、llama.cpp与LM Studio,配套SillyTavern、KoboldCpp与text-generation-webui可启用Smoothing参数提升聊天流畅度。
更适合谁
- 拥有16GB以上显存的本地推理玩家
- 追求强推理与编码能力的中文高级用户
- 需要视觉理解与256K长上下文的研究写作用户
- 不依赖云端、注重内容自主可控的创作者
典型使用场景
- 通用对话、知识问答与复杂推理任务
- 长文档阅读、写作辅助与创意故事生成
- 编程代理、代码生成与Agent工作流
- 视觉理解问答与图文混合分析
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多阶段微调与多模型融合提升指令跟随与问题求解
目标为不损伤原模型核心能力前提下全面提升ARC-C类指标
Heretic去审查显著降低拒绝率
在保留Qwen原能力同时将拒答比例由99/100降至4/100
原生256K长上下文且可扩展至百万级
适合长文档阅读、代码仓库级推理与多轮对话
图文到文本视觉能力
需额外下载mmproj投影文件以激活图像理解
兼具思考模式与指令模式并提供MTP量化
在LMStudio等工具下可利用多token预测提升吞吐
硬件怎么准备
- IQ2/IQ3可在8到12GB显存的设备勉强运行,适合尝鲜体验
- Q4_K_M与IQ4_XS推荐16GB显存,平衡质量与体积
- Q5_K_M需约17GB显存,Q6_K需约21GB显存
- Q8_0需约28GB以上显存,建议高端消费级GPU或工作站
量化版本怎么选
- 显存充裕优先选Q6_K或Q8_0以保留更多精度
- 16GB显存主流设备推荐Q4_K_M或IQ4_XS
- 显存紧张可选IQ3_M或IQ2_M,需接受一定质量损失
- 想试MTP加速可在LMStudio下使用带MTP后缀的Q4或Q5版本
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- LM Studio加载GGUF并可选配mmproj启用视觉
- Ollama导入GGUF作为本地模型调用
- llama.cpp命令行或作为后端服务运行
- SillyTavern与KoboldCpp搭配Smoothing参数用于聊天与角色扮演
采用前要知道的限制
- 模型卡未明确公布各量化的绝对速度与质量排名
- 去审查并不等于完全无引导,极端内容仍可能需要提示推动
- 27B参数在8GB以下显存设备上几乎不可用
- MTP量化在高温度或复杂创意场景下可能反而变慢,需根据token接受率切换
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。