← 返回模型库

JonathanColetti/Qwen3.8-27B-Uncensored-GGUF

Qwen3.8-27B-Uncensored-GGUF:去审查版中文多模态大模型

Qwen3.8-27B 的去审查 GGUF 量化版,通过 Heretic 去拒绝处理把 100 条有害提示的拒答从 98 降到 12。保留 27B 原架构、262K 上下文、视觉能力与 MTP 推测解码头。适合想要宽松回答、本地有 16GB 以上显存或 32GB 以上内存的用户。

去审查大模型中文长上下文本地多模态MTP 推测解码
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自基础模型 Qwen/Qwen3.8-27B,本仓库只做去拒绝权重修改与 GGUF 量化,架构为 Qwen3_5ForConditionalGeneration、64 层、248320 词表、262144 上下文、内置 MTP 层与视觉塔,并支持英语与中文。除拒答率显著降低外,原始训练数据与基准能力基本保持,MMLU、ARC、HellaSwag、Winogrande 均值仅下降 0.5 分。仓库提供 IQ2_M 至 Q8_0 全部量化的融合版与 noMTP 双胞胎,以及独立的草稿头与视觉投影器。运行依赖 llama.cpp PR #22673 之后的版本以启用 MTP,Ollama、LM Studio、llama.cpp 均可加载。

更适合谁

  • 想要宽松回答且有本地 27B 模型部署条件的用户
  • 中英长上下文生成,最高 262K tokens
  • 有 16GB 以上显存或大内存、想体验 MTP 推测解码的本地玩家
  • 需要在本地同时使用文本与视觉输入的研究者

典型使用场景

  • 本地长文档理解与生成,最高 262K 上下文
  • 配合 ComfyUI-QwenVL 节点的多模态对话
  • 需要更宽松拒答策略的本地研究与角色扮演
  • 基于 MTP 草稿头做推测解码吞吐测试

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

拒答率大幅下降

Heretic abliteration 把有害提示拒答从 98/100 降到 12/100,首 token KL 约 0.119

原架构与能力保留

27B 参数、64 层、262K 上下文、视觉塔与 MTP 层未改动,能力基准均值仅下降 0.5 分

MTP 推测解码可用

草稿头以 Q8_0 与 Q4_0 单独发布,配合 llama.cpp PR #22673 后可启用

多模态视觉输入

提供 mmproj-F16.gguf,可在兼容视觉运行时加载图像

多档位完整量化

IQ2_M 至 Q8_0 均有融合版与 noMTP 版,并附 imatrix 数据供复现

硬件怎么准备

  • Q5_K_M 及以上:建议至少 24GB 内存或 17GB 显存
  • Q4_K_M 与 IQ4_XS:建议至少 16GB 内存或 14GB 显存
  • IQ2_M:建议至少 9.5GB 内存或 8GB 显存,但该档位拒答边界已最不稳定
  • 视觉输入需额外加载约 0.9GB 的 mmproj-F16 投影器

量化版本怎么选

  • 若优先保留拒答边界稳定性,建议选择 Q6_K 或 Q8_0
  • 平衡显存与质量可选 Q5_K_M
  • Q4_K_M 与 IQ4_XS 文件大小相近,PPL 差异在误差范围内
  • IQ2_M 已显著劣化且仓库未在 2 bit 测量拒答行为,避免用于关键用途

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直加载融合版自动启用内嵌 MTP 草稿头
  • llama.cpp 用 noMTP 目标文件加 draft 草稿头,通过 --model-draft 显式指定
  • Ollama 与 LM Studio 均可作为前端加载 GGUF
  • ComfyUI-QwenVL 节点支持文本与图像输入

采用前要知道的限制

  • 拒答是降低而非消除,仍有 12/100 被拒,且拒答边界比基础模型更不稳定
  • 模型卡未提供生成式、数学、代码或多语言基准的评估数据
  • 2 bit 量化会进一步弱化拒答边界行为,且仓库未在该档位做测量
  • MTP 推测解码需 llama.cpp PR #22673 之后的构建,旧版会静默忽略 MTP 张量