← 返回模型库

0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF

Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF:去审查27B长文本生成模型

基于Qwen3.8-27B双轮ARA去审查的27B参数文本生成模型,采用Gated DeltaNet混合架构支持262K上下文。适合追求低过滤创意写作、长篇角色扮演和成人向内容研究的用户,需较高显存,最低建议16GB内存跑Q4量化,24GB显卡可获得更佳体验。

去审查大模型27B长上下文角色扮演写作Qwen3.8量化
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库是Qwen3.8-27B基模型的Heretic ARA双轮去审查GGUF量化仓库,由社区作者在trohrbaugh的-ara基础上额外做两轮ARA处理,将有害提示拒绝率从3/100降至0-1/100,KL偏差控制在0.0085。模型卡未说明原始训练数据组成、预训练语料细节及标准基准跑分结果。仓库提供从IQ1到BF16/F16的多档量化文件,并附带MTP推测解码和官方Qwen3.8聊天模板。运行层兼容llama.cpp、Ollama、LM Studio等本地推理工具,并已通过OpenAI兼容API的工具调用验证。

更适合谁

  • 18岁以上需要低拒绝率生成的成人用户
  • 追求无过滤创意写作与角色扮演的内容创作者
  • 研究去审查技术的红队与AI安全研究人员
  • 需要本地离线长文档处理的个人开发者

典型使用场景

  • 长篇小说创作与角色扮演对话
  • 离线本地大文本生成与摘要
  • 红队测试与去审查方法对比实验
  • 多语言创意写作与翻译场景

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

双轮ARA精细化去审查

在KL偏差仅0.0085的前提下将有害提示拒绝率降至0-1/100

超长上下文窗口

原生262K token上下文,适合长文档和多轮长对话

Gated DeltaNet混合架构

16层标准注意力搭配48层线性注意力,兼顾推理效率

多档量化全覆盖

从IQ1到BF16/F16全谱系,适配从8GB到24GB以上显存

内嵌官方聊天模板

直接通过llama-server提供OpenAI兼容API与工具调用

硬件怎么准备

  • 8GB显存:仅可尝试IQ1级别部署,需CPU卸载并控制上下文长度
  • 12GB显存:建议IQ2或IQ3量化,需为KV缓存预留内存
  • 16GB内存:可运行Q4系列量化,Q4_K_M是平衡质量与体积的常用选项
  • 24GB显存:可舒适运行Q5_K_M或Q4_K_M并保留更长上下文空间

量化版本怎么选

  • 24GB显卡首选Q4_K_M,体积与质量较平衡
  • 显存紧张时选IQ2或IQ3量化,注意低比特质量明显下降
  • 多语言校准的-multilingual系列推荐用于新部署的低比特场景
  • 避免IQ1_M配合MTP使用,模型卡记录其生成速度反而下降约60%

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ13.1 GB3.5 GB4.5 GB8 GB文件 ↗
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp直接加载GGUF文件运行
  • Ollama拉取模型本地推理
  • LM Studio图形界面调用
  • llama-server启动OpenAI兼容HTTP服务

采用前要知道的限制

  • 主动移除多数安全护栏,仅限18岁以上用户合规使用
  • 模型卡未提供训练数据组成和标准基准测试结果
  • IQ1/IQ2低比特量化质量损失明显,不适合高要求任务
  • 化学武器等少数高危类别仍保留内置拒绝护栏