← 返回模型库

DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:去审查强化推理全能型

基于Qwen3.6-27B多阶段微调并经Heretic去审查,强化思考推理、指令跟随与通用能力,支持视觉与长上下文。27B体量对显存门槛较高,Q4量约需16GB显存、Q8需30GB以上,适合中文高级用户与本地推理爱好者使用MTP可进一步提速。

通用对话与推理视觉问答与长上下文去审查本地大模型编码与写作助手
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库为GGUF量化版本,提供常规与MTP多token预测两套NEO IMATRIX量化,覆盖IQ2到Q8共十余种规格,并含LOW与AMD/VULKAN特殊变体与mmproj视觉投影文件。模型卡未公开Q4_K_M等具体绝对速度数字。原模型Qwen3.6-27B由Qwen团队发布,主打Agent编码、推理、长上下文与视觉能力;本微调重点强化指令跟随与问题求解,并经Heretic去除拒绝倾向。运行工具支持Ollama、llama.cpp与LM Studio,配套SillyTavern、KoboldCpp与text-generation-webui可启用Smoothing参数提升聊天流畅度。

更适合谁

  • 拥有16GB以上显存的本地推理玩家
  • 追求强推理与编码能力的中文高级用户
  • 需要视觉理解与256K长上下文的研究写作用户
  • 不依赖云端、注重内容自主可控的创作者

典型使用场景

  • 通用对话、知识问答与复杂推理任务
  • 长文档阅读、写作辅助与创意故事生成
  • 编程代理、代码生成与Agent工作流
  • 视觉理解问答与图文混合分析

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多阶段微调与多模型融合提升指令跟随与问题求解

目标为不损伤原模型核心能力前提下全面提升ARC-C类指标

Heretic去审查显著降低拒绝率

在保留Qwen原能力同时将拒答比例由99/100降至4/100

原生256K长上下文且可扩展至百万级

适合长文档阅读、代码仓库级推理与多轮对话

图文到文本视觉能力

需额外下载mmproj投影文件以激活图像理解

兼具思考模式与指令模式并提供MTP量化

在LMStudio等工具下可利用多token预测提升吞吐

硬件怎么准备

  • IQ2/IQ3可在8到12GB显存的设备勉强运行,适合尝鲜体验
  • Q4_K_M与IQ4_XS推荐16GB显存,平衡质量与体积
  • Q5_K_M需约17GB显存,Q6_K需约21GB显存
  • Q8_0需约28GB以上显存,建议高端消费级GPU或工作站

量化版本怎么选

  • 显存充裕优先选Q6_K或Q8_0以保留更多精度
  • 16GB显存主流设备推荐Q4_K_M或IQ4_XS
  • 显存紧张可选IQ3_M或IQ2_M,需接受一定质量损失
  • 想试MTP加速可在LMStudio下使用带MTP后缀的Q4或Q5版本

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • LM Studio加载GGUF并可选配mmproj启用视觉
  • Ollama导入GGUF作为本地模型调用
  • llama.cpp命令行或作为后端服务运行
  • SillyTavern与KoboldCpp搭配Smoothing参数用于聊天与角色扮演

采用前要知道的限制

  • 模型卡未明确公布各量化的绝对速度与质量排名
  • 去审查并不等于完全无引导,极端内容仍可能需要提示推动
  • 27B参数在8GB以下显存设备上几乎不可用
  • MTP量化在高温度或复杂创意场景下可能反而变慢,需根据token接受率切换

COMPARISON PATH

继续对比同类方案

不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。