← 返回模型库

OBLITERATUS/Qwen3.8-27B-OBLITERATED

Qwen3.8-27B-OBLITERATED:去审查红队研究专用大模型

基于Qwen3.8-27B的去审查27.8B参数文本生成模型,通过迭代权重手术移除硬拒答与软偏转,适合AI安全研究、对齐测试和本地控制用户。提供Q2到Q8_0共八种GGUF量化,Q2_K最低约7GB显存可加载,Q4_K_M推荐16GB显存或19.5GB内存。

去审查大模型AI安全研究红队测试本地部署
查看模型源页面
下载量
0
参数
27.8B
上下文
未说明
架构 / 任务
qwen3_5
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,这是基于Qwen/Qwen3.8-27B经过三轮去审查权重手术(V3版本)的27.8B参数文本生成模型,MMLU得分82.33%,相比stock仅下降约2.12个百分点,擅长回答原本被拒答的限制性查询、代码生成与安全研究场景。量化仓库由作者OBLITERATUS在Hugging Face发布,提供Q2_K到Q8_0共八种GGUF量化及mmproj投影文件。运行工具支持llama.cpp(需启用--jinja模板)、Ollama、LM Studio,以及Transformers的safetensors格式;MLX格式待上游qwen3.5架构支持。上下文长度模型卡未说明。

更适合谁

  • AI安全与对齐研究人员
  • 红队与越狱测试评估者
  • 需要本地无审查基线的开发者
  • 偏好完全硬件控制的技术用户

典型使用场景

  • AI安全与对齐研究
  • 红队测试与越狱评估
  • 安全受限话题的本地化探索
  • 代码生成与安全审计实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

真实回答受限查询

通过权重手术消除硬拒答与软偏转,V3在1000+提示词上经人工审核

近原始能力保留

MMLU仅比stock下降2.12个百分点,文科类几乎无损

代码与安全任务可用

20/20完成网络安全代码生成,7/8完成高级真实任务

思考模式兼容

V3在thinking on/off下均不触发拒答

多量化可选

提供Q2_K到Q8_0共八种GGUF量化覆盖不同硬件

硬件怎么准备

  • Q2_K需要约7GB显存或8.5GB内存,最低配置尝试
  • Q4_K_M推荐16GB显存或19.5GB内存,是平衡选择
  • Q6_K推荐24GB显存或29.5GB内存,追求质量的选择
  • Q8_0需要约28GB显存或32.5GB内存,最高质量门槛较高

量化版本怎么选

  • Q4_K_M是甜点级,文件约16GB适合多数消费级显卡
  • Q5_K_M约18GB在24GB显卡上可获得更好效果
  • Q2_K最小可在8GB显存环境加载但能力下降明显
  • IQ4_XS是实验性紧凑方案约14GB,适合显存紧张但想要4比特质量的场景

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q26.5 GB7 GB8 GB10 GB文件 ↗
Q39.7 GB10.5 GB12 GB15 GB文件 ↗
IQ413 GB14 GB16 GB19.5 GB文件 ↗
Q413 GB14 GB16 GB19.5 GB文件 ↗
Q516 GB17.5 GB20 GB24.5 GB文件 ↗
BF1616 GB17.5 GB20 GB24.5 GB文件 ↗
Q619 GB21 GB24 GB29.5 GB文件 ↗
Q826 GB28 GB32 GB39 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp配合--jinja使用内置chat模板
  • Ollama通过GGUF直接加载
  • LM Studio图形界面调用
  • Transformers加载safetensors格式约54GB BF16权重

采用前要知道的限制

  • 已移除安全护栏,使用者需自行承担责任
  • 上下文长度模型卡未说明
  • MLX格式支持待上游qwen3.5架构适配
  • 相比原版STEM类能力下降最多约3.3个百分点