DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF:9B 参数去审查指令强化 GGUF 量化包
基于 Qwen3.5-9B 的多阶段微调与合并版本,主打指令遵循与通用智能提升,并移除拒绝行为,属于去审查类(Heretic)文本生成模型,同时支持视觉理解,需额外下载 mmproj 文件。
MODEL POSITIONING
这个模型解决什么问题?
模型能力源自 Qwen3.5-9B 基础架构,结合 Gated DeltaNet 与稀疏 MoE 的混合结构,并叠加 DavidAU 与 Nightmedia 的多阶段微调、Heretic 去审查与紧凑化推理块改造,强调指令遵循、推理、写作、角色扮演与编码等全场景表现,视觉能力开启需额外 mmproj 文件。量化仓库由作者本人发布的 GGUF 提供,采用 NEO IMATRIX 提升精度 2–4%,并同时提供常规版与 MTP(多 token 预测)版本,前者更稳定后者在低温度下更快。运行工具覆盖 Ollama、llama.cpp、LM Studio 以及 KoboldCpp、SillyTavern、text-generation-webui 等主流本地推理框架。模型卡未提供原始训练数据规模与对齐细节。
更适合谁
- 在 4–10GB 内存或同档显存设备上跑 9B 模型的本地玩家
- 想要减少模型拒答、追求直接执行指令的中英文创作者与角色扮演用户
- 需要 256k 长上下文并兼顾代码与写作的多用途本地用户
- 偏好 GGUF 量化、希望在 Ollama 或 LM Studio 一键加载的开源爱好者
典型使用场景
- 中英文长文写作、创意故事与角色扮演对话生成
- 编程任务、代码补全与 Web 类开发辅助
- 256k 长文档摘要、检索式问答与多轮长对话
- 图像理解配合 mmproj 的图文问答与文档解析
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
指令遵循强化
模型卡称经过多阶段微调以提升指令响应与综合智能
去审查与 Heretic 训练
模型卡显示 KL 散度 0.0793,拒答率由 100/100 降至 6/100
长上下文与多语言
原生 262144 tokens,可扩展至约 101 万 tokens,支持 201 种语言
视觉多模态
继承 Qwen3.5 视觉编码器,需额外 mmproj 文件启用图像理解
量化精度优化
NEO IMATRIX 量化相对常规 GGUF 提升 2–4%,输出张量保留 16 位精度
硬件怎么准备
- 内存 4GB、显存约 2.5GB 设备可尝试 IQ2_M(2.25GB)作为最低门槛
- 内存 8GB、显存 5–6GB 推荐 IQ4_NL 或 Q4_K_M(4.5GB),可获得较好质量
- 内存 10.5GB、显存约 9.5GB 可选 Q8_0(9GB)以接近原始精度
- 启用视觉或多轮长对话时建议内存留有 2GB 以上余量
量化版本怎么选
- 极致低配设备选择 IQ2_M,作者标注最低可用档位为 IQ3 系列
- 平衡场景首选 IQ4_NL 或 Q4_K_M(MTP 版本),兼顾速度与质量
- 高质量本地运行推荐 Q5_K_M 或 Q6_K,MTP 版本在 temp≤1 时速度优势明显
- MTP 版本在创作或高温采样下可能变慢,建议同时备一份常规 GGUF 对比
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。
阅读 4GB 显存选型指南 →可以怎样运行
- Ollama 加载常规或 MTP GGUF,适合一键命令行启动
- LM Studio 与 llama.cpp 桌面端推理,支持 MTP 与常规量化切换
- KoboldCpp、SillyTavern、text-generation-webui 用于聊天与角色扮演
- 视觉使用需额外下载并放置 mmproj 文件,建议参数 smoothing_factor=1.5
采用前要知道的限制
- 模型卡未提供具体训练数据组成与对齐细节
- 去审查版本可能生成不当内容,需使用者自行管控输出
- 视频理解能力未经作者测试,模型卡未做承诺
- 硬件建议仅基于 GGUF 文件大小估算,不承诺实际生成速度