下载量
0
参数
9.7B
上下文
未说明
架构 / 任务
qwen3_5
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自模型卡:基于 Qwen3.5 混合架构(Gated DeltaNet + 全注意力),9B 参数、32 层 Transformer,保留代码生成与推理能力,支持思考模式(推荐关闭)并附带视觉编码器;经过 4 轮定向消融手术去除 RL 安全对齐。量化仓库提供 Q2_K 至 Q8_0、BF16 与 IQ4_XS 共八种 GGUF,越高量化越能保留解放度。运行工具支持 Ollama、llama.cpp、LM Studio。上限上下文长度模型卡未说明。功能调用相比原版有部分降级。
更适合谁
- 对齐研究人员研究 RL 拒绝机制
- 红队与安全测试专业人员
- 在外部实现安全层的应用开发者
- 研究 Qwen3.5 混合架构消融边界的学者
典型使用场景
- 受限主题的学术与安全研究
- 代理与工具调用脚本生成
- 网络安全场景下的功能性代码生成
- 长上下文连贯性测试
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
高度无过滤响应
在受限主题下保持高解放率
代码与推理能力保留
编码和代理能力与原版持平
视觉扩展支持
附带视觉编码器可做多模态
思考模式可切换
支持 Ornith 思考模式并可关闭
长上下文连贯
较原版略有提升
硬件怎么准备
- Q2_K 至少 4GB 内存或 2.5GB 显存
- Q4_K_M 与 IQ4_XS 至少 6GB 内存或 5GB 显存
- Q6_K 至少 8.5GB 内存或 7.5GB 显存
- Q8_0 至少 11.5GB 内存或 10GB 显存
量化版本怎么选
- Q8_0 与 Q6_K 推荐用于最大化解放保真度
- Q4_K_M 体积与质量平衡
- Q2_K 与 Q3_K_M 在困难提示下可能重新出现拒绝
- 关键研究建议从 BF16 或 Q6_K 起
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。
阅读 4GB 显存选型指南 →可以怎样运行
- Ollama 本地一键部署
- llama.cpp GGUF 推理并使用 --reasoning off
- LM Studio 图形化运行
- Transformers bf16 直接加载
采用前要知道的限制
- MMLU 较原版下降约 4 个百分点
- 功能调用能力较原版部分降级
- 低量化在困难提示下可能恢复拒绝
- 9B 模型在复杂合成类话题可能产生幻觉