下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,该仓库提供的是 Qwen3.8-27B 的去审查(ablation)实现,仅对部分层做消融,MTP 与视觉模块未改动,理论上保留原模型的多模态与多 token 预测能力,但具体任务表现模型卡未提供对比数据。量化仓库方面,提供 Q2 到 Q8 共十余种 GGUF 文件,并对部分层采用非标准混合精度以改善低量化版本质量,体积与精度不再严格递增。运行工具方面,官方提示可在最新版 Ollama 中直接拉取 huihui_ai/Qwen3.8-abliterated,同时兼容 llama.cpp 与 LM Studio。
更适合谁
- 进行受限话题或消融对比研究的高级用户
- 希望本地部署 27B 规模图文模型的研究者
- 拥有 16GB 以上显存并熟悉 Ollama 或 llama.cpp 的开发者
典型使用场景
- 本地受限话题对话与角色扮演实验
- 模型消融前后行为差异对比研究
- 多模态对话在去审查设置下的能力测试
- 量化策略与生成质量评估
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
保留视觉与 MTP 模块
消融未触及视觉与多 token 预测组件,维持原多模态能力
混合精度量化
对关键权重提升精度以改善低量化版本回复质量
多档位 GGUF 量化
提供 Q2 到 Q8 与 BF16 共十余种选择
主流推理工具支持
兼容 Ollama、llama.cpp 与 LM Studio
硬件怎么准备
- Q2 与 IQ2 文件约 6.75GB,建议至少 7GB 显存或 9.5GB 内存
- Q3 与 IQ3 文件约 10.13GB,建议至少 10.5GB 显存或 14.5GB 内存
- Q4 与 IQ4 文件约 13.5GB,建议至少 14GB 显存或 19GB 内存
- Q8 文件约 27GB,建议至少 27.5GB 显存或 38GB 内存
量化版本怎么选
- 低显存场景可尝试 Q2_K_L 或 UD-IQ2_S-MTP 系列
- 16GB 显存设备推荐 Q4_K_L 平衡体积与质量
- 20GB 以上显存可考虑 Q5_K_L 或 BF16 提升表现
- 高质量需求可选 Q6_K_L 或 Q8_0_L,需更多显存
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| Q3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- Ollama 拉取 huihui_ai/Qwen3.8-abliterated 直接运行
- 使用最新版 llama.cpp 加载 GGUF 文件
- 在 LM Studio 中选择对应 GGUF 加载
- 通过 transformers 库加载原始权重
采用前要知道的限制
- 模型卡未提供具体上下文长度参数
- 仅部分层被消融,可能仍残留部分拒绝行为
- 安全过滤显著削弱,不适用于未成年或公开服务
- 部分非标准混合精度量化体积可能与直觉相反,需参考 README