下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来源于HauhauCS对Qwen3.5-9B的去审查微调,Aggressive变体采用更强去审查策略,作者称保留原始多模态和混合注意力架构,模型卡未提供具体任务评测数据。量化仓库由HauhauCS发布GGUF文件,提供Q4_K_M、Q6_K、Q8_0、BF16共4个精度及独立视觉编码器mmproj。运行工具支持Ollama、llama.cpp、LM Studio、Jan、koboldcpp等,需使用较新版本以兼容该混合架构,模型卡未说明具体最低版本号。
更适合谁
- 寻求无审查对话与创意生成的中文及多语言用户
- 拥有6GB以上显存并希望本地部署多模态模型的玩家
- 需要长上下文处理的研究与工程尝鲜者
- 能接受偶尔免责声明的开放使用场景
典型使用场景
- 无限制对话与创意写作场景
- 图文视频多模态内容理解与生成
- 超长文档摘要与跨语种翻译
- 本地部署的开放域问答与角色扮演
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
去审查生成
作者称移除原始Qwen3.5-9B的安全拒绝机制
原生多模态
同时支持文本、图像、视频输入,需配合mmproj文件
超长上下文
原生262K,YaRN可扩展至1M,需维持128K以上保留思维链
多语言覆盖
248K词表支持201种语言,含中英文
混合注意力架构
Gated DeltaNet线性注意力与全softmax注意力3:1混合
硬件怎么准备
- Q4_K_M量化最低需5.5GB内存或5GB显存,推荐8GB内存或6GB显存
- Q6_K量化最低需8GB内存或7GB显存,推荐9.5GB内存或8GB显存
- Q8_0量化最低需10.5GB内存或9.5GB显存,推荐13GB内存或11GB显存
- BF16量化最低需7GB内存或6GB显存,推荐8GB内存或7GB显存;另需约880MB加载视觉编码器
量化版本怎么选
- Q4_K_M体积最小,适合显存紧张设备
- Q6_K为质量与体积平衡点
- Q8_0保留更多精度,适合显存10GB以上用户
- BF16适合全精度研究与微调场景
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。
阅读 8GB 显存选型指南 →可以怎样运行
- Ollama一键部署与命令行调用
- LM Studio图形界面加载
- llama.cpp命令行运行并加载mmproj支持视觉
- Jan与koboldcpp等兼容前端
采用前要知道的限制
- 模型卡未提供具体任务评测数据
- 需使用2026年3月之后较新llama.cpp版本,旧版可能不兼容
- Aggressive变体可能输出不当内容,使用者需自行承担责任
- 偶尔会在回复末尾附加简短免责声明