← 返回模型库查看模型源页面 ↗
HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:去审查激进MoE多模态长上下文
基于 Qwen3.6-35B-A3B 底座的激进去审查变体,35B 总参数 MoE 架构每次仅激活约 3B,支持 262K 原生上下文与文本、图像、视频多模态输入。Q4/IQ4 量化估计需要 24GB 以上内存或 20GB 以上显存,适合具备高端硬件、追求长上下文多模态推理且不介意去除内容审查限制的本地部署用户。
去审查大模型多模态长上下文MoE 本地部署Qwen3.6 衍生
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力源自基座 Qwen/Qwen3.6-35B-A3B,HauhauCS 仅去除拒绝行为而未改动数据集或训练流程,模型卡未提供具体任务基准成绩。量化仓库由 HauhauCS 维护,提供 K_P 系列自定义量化与 imatrix 校准,相对同档位提升约 1-2 级质量。运行支持 llama.cpp(建议带 --jinja 参数)、LM Studio、Ollama、Jan、koboldcpp 等 GGUF 兼容工具,多模态需额外加载 mmproj 文件。
更适合谁
- 想要绕开内容审查进行本地研究或创作的用户
- 拥有 24GB 以上显存或 32GB 以上内存的高端本地部署者
- 需要 262K 长上下文处理长文档与多模态输入的开发者
- 熟悉 MoE 架构调参与推理参数设置的高级用户
典型使用场景
- 长文档多模态问答与多轮推理
- 图像或视频内容理解与文本生成
- 复杂代码生成、数学与逻辑推理
- 受较少审查限制的创意写作与角色扮演
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
35B 总参数 MoE 每次仅激活约 3B
256 专家中 8 个路由,兼顾规模与推理开销
原生 262K 上下文与多模态输入
支持文本、图像、视频,融合线性与全 softmax 注意力
0/465 拒绝率的激进去审查策略
完整保留基座模型能力,仅移除安全限制
自定义 K_P 量化相对同档位提升 1-2 级
基于重要性矩阵与模型专属分析
兼容主流 GGUF 运行时无需特殊构建
支持 llama.cpp、LM Studio、Ollama 等
硬件怎么准备
- IQ2_M/Q2_K_P 估计需要 10.5GB 内存或 9GB 显存
- IQ3_M/Q3_K_P 估计需要 15.5GB 内存或 13.5GB 显存
- IQ4_NL/Q4_K_M 估计推荐 24.5GB 内存或 20.5GB 显存
- Q6_K_P 估计推荐 37GB 内存或 30.5GB 显存,Q8_K_P 估计推荐 49GB 内存或 40.5GB 显存
量化版本怎么选
- 显存有限时优先选择 IQ4_NL 或 Q4_K_M 平衡体积与质量
- 内存 16GB 左右可考虑 IQ3_M 或 Q3_K_P 档位
- K_P 系列相对同档位质量更高但体积增加约 5-15%
- 使用多模态需额外下载 mmproj-f16 文件配合主模型
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| Q2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| IQ3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| Q3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| IQ4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q5 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| F16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q6 | 24 GB | 26.5 GB | 30.5 GB | 37 GB | 文件 ↗ |
| Q8 | 33 GB | 35.5 GB | 40.5 GB | 49 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 9GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 10.5GB。
阅读 12GB 显存选型指南 →可以怎样运行
- llama.cpp 加载并启用 --jinja 模板以正确处理聊天格式
- LM Studio 直接导入 GGUF(K_P 量化列显示为 ? 属正常)
- Ollama 兼容 GGUF 模型直接拉取运行
- Jan、koboldcpp 等其他 GGUF 兼容运行时
采用前要知道的限制
- 模型卡未提供基准跑分与速度数据
- 模型卡未明确说明上下文之外的细节能力
- 激进去审查可能偶尔附带基座模型自带的简短免责声明
- HuggingFace 硬件兼容工具可能无法识别 K_P 量化导致显示不全