← 返回模型库

DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF:9B 参数去审查指令强化 GGUF 量化包

基于 Qwen3.5-9B 的多阶段微调与合并版本,主打指令遵循与通用智能提升,并移除拒绝行为,属于去审查类(Heretic)文本生成模型,同时支持视觉理解,需额外下载 mmproj 文件。

去审查模型长上下文视觉多模态角色写作
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力源自 Qwen3.5-9B 基础架构,结合 Gated DeltaNet 与稀疏 MoE 的混合结构,并叠加 DavidAU 与 Nightmedia 的多阶段微调、Heretic 去审查与紧凑化推理块改造,强调指令遵循、推理、写作、角色扮演与编码等全场景表现,视觉能力开启需额外 mmproj 文件。量化仓库由作者本人发布的 GGUF 提供,采用 NEO IMATRIX 提升精度 2–4%,并同时提供常规版与 MTP(多 token 预测)版本,前者更稳定后者在低温度下更快。运行工具覆盖 Ollama、llama.cpp、LM Studio 以及 KoboldCpp、SillyTavern、text-generation-webui 等主流本地推理框架。模型卡未提供原始训练数据规模与对齐细节。

更适合谁

  • 在 4–10GB 内存或同档显存设备上跑 9B 模型的本地玩家
  • 想要减少模型拒答、追求直接执行指令的中英文创作者与角色扮演用户
  • 需要 256k 长上下文并兼顾代码与写作的多用途本地用户
  • 偏好 GGUF 量化、希望在 Ollama 或 LM Studio 一键加载的开源爱好者

典型使用场景

  • 中英文长文写作、创意故事与角色扮演对话生成
  • 编程任务、代码补全与 Web 类开发辅助
  • 256k 长文档摘要、检索式问答与多轮长对话
  • 图像理解配合 mmproj 的图文问答与文档解析

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

指令遵循强化

模型卡称经过多阶段微调以提升指令响应与综合智能

去审查与 Heretic 训练

模型卡显示 KL 散度 0.0793,拒答率由 100/100 降至 6/100

长上下文与多语言

原生 262144 tokens,可扩展至约 101 万 tokens,支持 201 种语言

视觉多模态

继承 Qwen3.5 视觉编码器,需额外 mmproj 文件启用图像理解

量化精度优化

NEO IMATRIX 量化相对常规 GGUF 提升 2–4%,输出张量保留 16 位精度

硬件怎么准备

  • 内存 4GB、显存约 2.5GB 设备可尝试 IQ2_M(2.25GB)作为最低门槛
  • 内存 8GB、显存 5–6GB 推荐 IQ4_NL 或 Q4_K_M(4.5GB),可获得较好质量
  • 内存 10.5GB、显存约 9.5GB 可选 Q8_0(9GB)以接近原始精度
  • 启用视觉或多轮长对话时建议内存留有 2GB 以上余量

量化版本怎么选

  • 极致低配设备选择 IQ2_M,作者标注最低可用档位为 IQ3 系列
  • 平衡场景首选 IQ4_NL 或 Q4_K_M(MTP 版本),兼顾速度与质量
  • 高质量本地运行推荐 Q5_K_M 或 Q6_K,MTP 版本在 temp≤1 时速度优势明显
  • MTP 版本在创作或高温采样下可能变慢,建议同时备一份常规 GGUF 对比

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ22.1 GB2.5 GB3.5 GB8 GB文件 ↗
IQ33.1 GB3.5 GB4.5 GB8 GB文件 ↗
IQ44.2 GB5 GB6 GB8 GB文件 ↗
Q44.2 GB5 GB6 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
F165.2 GB6 GB7 GB8 GB文件 ↗
GGUF5.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • Ollama 加载常规或 MTP GGUF,适合一键命令行启动
  • LM Studio 与 llama.cpp 桌面端推理,支持 MTP 与常规量化切换
  • KoboldCpp、SillyTavern、text-generation-webui 用于聊天与角色扮演
  • 视觉使用需额外下载并放置 mmproj 文件,建议参数 smoothing_factor=1.5

采用前要知道的限制

  • 模型卡未提供具体训练数据组成与对齐细节
  • 去审查版本可能生成不当内容,需使用者自行管控输出
  • 视频理解能力未经作者测试,模型卡未做承诺
  • 硬件建议仅基于 GGUF 文件大小估算,不承诺实际生成速度