下载量
0
参数
27.8B
上下文
未说明
架构 / 任务
qwen3_5
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,这是基于Qwen/Qwen3.8-27B经过三轮去审查权重手术(V3版本)的27.8B参数文本生成模型,MMLU得分82.33%,相比stock仅下降约2.12个百分点,擅长回答原本被拒答的限制性查询、代码生成与安全研究场景。量化仓库由作者OBLITERATUS在Hugging Face发布,提供Q2_K到Q8_0共八种GGUF量化及mmproj投影文件。运行工具支持llama.cpp(需启用--jinja模板)、Ollama、LM Studio,以及Transformers的safetensors格式;MLX格式待上游qwen3.5架构支持。上下文长度模型卡未说明。
更适合谁
- AI安全与对齐研究人员
- 红队与越狱测试评估者
- 需要本地无审查基线的开发者
- 偏好完全硬件控制的技术用户
典型使用场景
- AI安全与对齐研究
- 红队测试与越狱评估
- 安全受限话题的本地化探索
- 代码生成与安全审计实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
真实回答受限查询
通过权重手术消除硬拒答与软偏转,V3在1000+提示词上经人工审核
近原始能力保留
MMLU仅比stock下降2.12个百分点,文科类几乎无损
代码与安全任务可用
20/20完成网络安全代码生成,7/8完成高级真实任务
思考模式兼容
V3在thinking on/off下均不触发拒答
多量化可选
提供Q2_K到Q8_0共八种GGUF量化覆盖不同硬件
硬件怎么准备
- Q2_K需要约7GB显存或8.5GB内存,最低配置尝试
- Q4_K_M推荐16GB显存或19.5GB内存,是平衡选择
- Q6_K推荐24GB显存或29.5GB内存,追求质量的选择
- Q8_0需要约28GB显存或32.5GB内存,最高质量门槛较高
量化版本怎么选
- Q4_K_M是甜点级,文件约16GB适合多数消费级显卡
- Q5_K_M约18GB在24GB显卡上可获得更好效果
- Q2_K最小可在8GB显存环境加载但能力下降明显
- IQ4_XS是实验性紧凑方案约14GB,适合显存紧张但想要4比特质量的场景
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp配合--jinja使用内置chat模板
- Ollama通过GGUF直接加载
- LM Studio图形界面调用
- Transformers加载safetensors格式约54GB BF16权重
采用前要知道的限制
- 已移除安全护栏,使用者需自行承担责任
- 上下文长度模型卡未说明
- MLX格式支持待上游qwen3.5架构适配
- 相比原版STEM类能力下降最多约3.3个百分点