下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自基础模型 Qwen/Qwen3.8-27B,本仓库只做去拒绝权重修改与 GGUF 量化,架构为 Qwen3_5ForConditionalGeneration、64 层、248320 词表、262144 上下文、内置 MTP 层与视觉塔,并支持英语与中文。除拒答率显著降低外,原始训练数据与基准能力基本保持,MMLU、ARC、HellaSwag、Winogrande 均值仅下降 0.5 分。仓库提供 IQ2_M 至 Q8_0 全部量化的融合版与 noMTP 双胞胎,以及独立的草稿头与视觉投影器。运行依赖 llama.cpp PR #22673 之后的版本以启用 MTP,Ollama、LM Studio、llama.cpp 均可加载。
更适合谁
- 想要宽松回答且有本地 27B 模型部署条件的用户
- 中英长上下文生成,最高 262K tokens
- 有 16GB 以上显存或大内存、想体验 MTP 推测解码的本地玩家
- 需要在本地同时使用文本与视觉输入的研究者
典型使用场景
- 本地长文档理解与生成,最高 262K 上下文
- 配合 ComfyUI-QwenVL 节点的多模态对话
- 需要更宽松拒答策略的本地研究与角色扮演
- 基于 MTP 草稿头做推测解码吞吐测试
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
拒答率大幅下降
Heretic abliteration 把有害提示拒答从 98/100 降到 12/100,首 token KL 约 0.119
原架构与能力保留
27B 参数、64 层、262K 上下文、视觉塔与 MTP 层未改动,能力基准均值仅下降 0.5 分
MTP 推测解码可用
草稿头以 Q8_0 与 Q4_0 单独发布,配合 llama.cpp PR #22673 后可启用
多模态视觉输入
提供 mmproj-F16.gguf,可在兼容视觉运行时加载图像
多档位完整量化
IQ2_M 至 Q8_0 均有融合版与 noMTP 版,并附 imatrix 数据供复现
硬件怎么准备
- Q5_K_M 及以上:建议至少 24GB 内存或 17GB 显存
- Q4_K_M 与 IQ4_XS:建议至少 16GB 内存或 14GB 显存
- IQ2_M:建议至少 9.5GB 内存或 8GB 显存,但该档位拒答边界已最不稳定
- 视觉输入需额外加载约 0.9GB 的 mmproj-F16 投影器
量化版本怎么选
- 若优先保留拒答边界稳定性,建议选择 Q6_K 或 Q8_0
- 平衡显存与质量可选 Q5_K_M
- Q4_K_M 与 IQ4_XS 文件大小相近,PPL 差异在误差范围内
- IQ2_M 已显著劣化且仓库未在 2 bit 测量拒答行为,避免用于关键用途
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 直加载融合版自动启用内嵌 MTP 草稿头
- llama.cpp 用 noMTP 目标文件加 draft 草稿头,通过 --model-draft 显式指定
- Ollama 与 LM Studio 均可作为前端加载 GGUF
- ComfyUI-QwenVL 节点支持文本与图像输入
采用前要知道的限制
- 拒答是降低而非消除,仍有 12/100 被拒,且拒答边界比基础模型更不稳定
- 模型卡未提供生成式、数学、代码或多语言基准的评估数据
- 2 bit 量化会进一步弱化拒答边界行为,且仓库未在该档位做测量
- MTP 推测解码需 llama.cpp PR #22673 之后的构建,旧版会静默忽略 MTP 张量