← 返回模型库

HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive

Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型

基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。

多模态对话去审查长上下文
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来源于HauhauCS对Qwen3.5-9B的去审查微调,Aggressive变体采用更强去审查策略,作者称保留原始多模态和混合注意力架构,模型卡未提供具体任务评测数据。量化仓库由HauhauCS发布GGUF文件,提供Q4_K_M、Q6_K、Q8_0、BF16共4个精度及独立视觉编码器mmproj。运行工具支持Ollama、llama.cpp、LM Studio、Jan、koboldcpp等,需使用较新版本以兼容该混合架构,模型卡未说明具体最低版本号。

更适合谁

  • 寻求无审查对话与创意生成的中文及多语言用户
  • 拥有6GB以上显存并希望本地部署多模态模型的玩家
  • 需要长上下文处理的研究与工程尝鲜者
  • 能接受偶尔免责声明的开放使用场景

典型使用场景

  • 无限制对话与创意写作场景
  • 图文视频多模态内容理解与生成
  • 超长文档摘要与跨语种翻译
  • 本地部署的开放域问答与角色扮演

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

去审查生成

作者称移除原始Qwen3.5-9B的安全拒绝机制

原生多模态

同时支持文本、图像、视频输入,需配合mmproj文件

超长上下文

原生262K,YaRN可扩展至1M,需维持128K以上保留思维链

多语言覆盖

248K词表支持201种语言,含中英文

混合注意力架构

Gated DeltaNet线性注意力与全softmax注意力3:1混合

硬件怎么准备

  • Q4_K_M量化最低需5.5GB内存或5GB显存,推荐8GB内存或6GB显存
  • Q6_K量化最低需8GB内存或7GB显存,推荐9.5GB内存或8GB显存
  • Q8_0量化最低需10.5GB内存或9.5GB显存,推荐13GB内存或11GB显存
  • BF16量化最低需7GB内存或6GB显存,推荐8GB内存或7GB显存;另需约880MB加载视觉编码器

量化版本怎么选

  • Q4_K_M体积最小,适合显存紧张设备
  • Q6_K为质量与体积平衡点
  • Q8_0保留更多精度,适合显存10GB以上用户
  • BF16适合全精度研究与微调场景

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q44.2 GB5 GB6 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • Ollama一键部署与命令行调用
  • LM Studio图形界面加载
  • llama.cpp命令行运行并加载mmproj支持视觉
  • Jan与koboldcpp等兼容前端

采用前要知道的限制

  • 模型卡未提供具体任务评测数据
  • 需使用2026年3月之后较新llama.cpp版本,旧版可能不兼容
  • Aggressive变体可能输出不当内容,使用者需自行承担责任
  • 偶尔会在回复末尾附加简短免责声明