← 返回模型库

soyaakinohara/qwen3.8-27b-abliterated-3.69bpw-12GB-MTP.gguf

qwen3.8-27b-abliterated-3.69bpw-12GB-MTP.gguf:无审查混合量化长上下文本地点推理

基于 Qwen3.8-27B 的无审查派生版本,沿用 Gated-DeltaNet 混合注意力与 MTP 推测解码,3.69 bpw 混合量化将文件压至约 11.73 GiB,原生支持 262K 上下文。适合本地长文档阅读、摘要与编程辅助,需约 24GB 内存或 19.5GB 显存,无内置安全层。

长上下文无审查混合量化MTP 推测解码
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

此档案只描述该 GGUF 文件本身的能力边界与运行方式,不复述上游基准。模型能力继承自 AEON-7 移除拒绝训练的 Qwen3.8-27B 派生 BF16 权重,使用 Qwen3.5/Qwen3.8 混合 Gated-DeltaNet 加全注意力结构。量化仓库采用 3.69 bpw 分层映射,对 Gated-DeltaNet 关键张量使用 Q4_K/Q8_0,FFN 中部降为 IQ2_S,注意力 Q/K/V 保持 Q5_K,输出与 MTP 头为 Q6_K。运行工具兼容 llama.cpp、Ollama 与 LM Studio。模型卡未说明与官方 Qwen3.8-27B 的质量对比与具体对齐方式。

更适合谁

  • 具备 24GB 以上内存或 19.5GB 以上显存的本地推理用户
  • 希望在消费级硬件尝试 27B 长上下文模型的爱好者
  • 能自行加内容过滤并接受无审查输出的研究与创作人员

典型使用场景

  • 本地长文档阅读、摘要与多轮问答
  • 编程辅助与代码生成,calibration 含 llama.cpp 源码
  • 日语、英文及混合语言创作与翻译
  • 个人研究用途的文本生成实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

长上下文支持

原生 262K tokens 上下文窗口,适合长文档处理

混合量化策略

对 Gated-DeltaNet 敏感路径分配更高比特,兼顾体积与质量

MTP 推测解码

保留 MTP 头,可在 llama.cpp 中启用 draft-mtp 加速

无审查权重

基于移除拒绝训练的 AEON-7 BF16 派生版本

27B 参数规模

在约 11.73 GiB 文件大小下提供 27B 参数的本地推理

硬件怎么准备

  • 最低约 20GB 内存或 17GB 显存可加载,但速度与上下文受限
  • 推荐 24GB 内存或 19.5GB 显存以获得稳定推理体验
  • 显存路径优先使用 llama.cpp 的 GPU 卸载配置
  • 内存紧张时可关闭 MTP 或缩减 draft-mtp 深度

量化版本怎么选

  • 仓库仅提供这 1 个 GGUF 文件,标称 3.69 bpw 混合量化
  • Gated-DeltaNet 关键路径 Q4_K/Q8_0,FFN 中部 IQ2_S,注意力 Q/K/V 为 Q5_K
  • MTP 张量无 imatrix,以 Q6_K 保留
  • 若需更高精度,需自行寻找 BF16 或更高比特 GGUF

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF16 GB17 GB19.5 GB24 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载,启用 draft-mtp 可使用 MTP 推测解码
  • Ollama 拉取同名仓库即可启动
  • LM Studio 加载 GGUF 文件进行本地推理
  • 本地服务建议绑定 127.0.0.1 而非 0.0.0.0

采用前要知道的限制

  • 无内置安全层,输出可能包含不当内容,需自行加过滤
  • 模型卡未提供与官方 Qwen3.8-27B 的质量对比数据
  • 峰值速度仅在特定硬件上单次报告,其他设备无法保证
  • 原始上游来源为 Qwen/Qwen3.8-27B,需以官方模型卡为准