HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF:直答型多模态加速生成
这是基于 Qwen3.8-27B 的去审查 Aggressive 变体,27B 参数保留原生多模态、长上下文与推理能力,主打直接回答、低拒答,并附带 HauhauCS FastMTP 加速侧车。适合追求快速响应、不在意安全过滤的本地用户,硬件门槛较高,Q4 量级需 16GB 内存,Q8 需 31.5GB 以上。
MODEL POSITIONING
这个模型解决什么问题?
模型能力来源于 Qwen3.8-27B 原始模型卡,包含文本、推理、Agent、图片与视频理解能力,本仓库在其上应用 Aggressive 去审查策略,并保留原生 NextN 头与额外的 FastMTP 加速侧车;这是一个 GGUF 量化仓库,提供从 IQ2 到 Q8_K_P 共十余种 K_P 与 IQ 量化等级,BF16 投影器用于视觉任务;推荐运行工具为 llama.cpp(建议使用支持 Qwen3.8/MTP 的较新构建),LM Studio、Jan、KoboldCpp 等 GGUF 前端可基础兼容,HauhauCS FastMTP 需应用专属补丁。模型卡未说明训练数据与原始基准评测。
更适合谁
- 本地部署追求低拒答与直接回答的进阶用户
- 拥有 16GB 以上内存或显存的多模态尝鲜者
- 需要长上下文且希望加速推理的实验型开发者
- 愿意自行编译补丁与配置侧车的折腾型玩家
典型使用场景
- 多模态对话与图像理解(需配合 BF16 投影器)
- 超长上下文文档处理(原生 262144 token)
- 通过 FastMTP 加速的本地推理实验
- 绕过内容审查的直接问答场景
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态原生支持
保留 Qwen3.8-27B 的图像、视频与文本联合理解能力
Aggressive 去审查风格
直接回答、低拒答、最小铺垫
FastMTP 加速侧车
提供额外的 32K draft 加速配置
超长原生上下文
262144 token,可扩展至百万级
K_P 定制量化
相对同级量化提升质量且体积仅增 5–15%
硬件怎么准备
- Q4_K_P 或 IQ4_XS 量级建议至少 16GB 内存或 14GB 显存
- Q8_K_P 高保真需 31.5GB 内存或 27.5GB 显存
- IQ2_M 或 Q2_K_P 低量化可在 8GB 内存勉强运行
- 启用 FastMTP 侧车需额外约 20GB 内存与高端 GPU
量化版本怎么选
- 平衡质量与体积选 Q4_K_P 或 IQ4_XS(约 13.5GB 文件)
- 显存充足且要求高保真选 Q6_K_P 或 Q8_K_P
- 极低显存环境可尝试 IQ2_M(约 6.75GB 文件)
- 需要视觉能力必须额外下载 BF16 投影器(约 931MB)
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| Q2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 推荐并需支持 MTP 与 Qwen3.8 的较新构建
- LM Studio、Jan、KoboldCpp 可基础加载文本量化
- HauhauCS FastMTP 需应用专属补丁并搭配专用侧车
- Ollama 支持加载 GGUF 但 FastMTP 需自行配置
采用前要知道的限制
- 标记为 Uncensored/Aggressive,可能生成未过滤内容
- 部分前端对 K_P 量化识别可能异常显示为未知
- FastMTP 加速为仓库作者专属,非通用标准
- 27B 模型原生上下文长,KV 缓存显存开销大