soyaakinohara/qwen3.8-27b-abliterated-3.69bpw-12GB-MTP.gguf
qwen3.8-27b-abliterated-3.69bpw-12GB-MTP.gguf:无审查混合量化长上下文本地点推理
基于 Qwen3.8-27B 的无审查派生版本,沿用 Gated-DeltaNet 混合注意力与 MTP 推测解码,3.69 bpw 混合量化将文件压至约 11.73 GiB,原生支持 262K 上下文。适合本地长文档阅读、摘要与编程辅助,需约 24GB 内存或 19.5GB 显存,无内置安全层。
MODEL POSITIONING
这个模型解决什么问题?
此档案只描述该 GGUF 文件本身的能力边界与运行方式,不复述上游基准。模型能力继承自 AEON-7 移除拒绝训练的 Qwen3.8-27B 派生 BF16 权重,使用 Qwen3.5/Qwen3.8 混合 Gated-DeltaNet 加全注意力结构。量化仓库采用 3.69 bpw 分层映射,对 Gated-DeltaNet 关键张量使用 Q4_K/Q8_0,FFN 中部降为 IQ2_S,注意力 Q/K/V 保持 Q5_K,输出与 MTP 头为 Q6_K。运行工具兼容 llama.cpp、Ollama 与 LM Studio。模型卡未说明与官方 Qwen3.8-27B 的质量对比与具体对齐方式。
更适合谁
- 具备 24GB 以上内存或 19.5GB 以上显存的本地推理用户
- 希望在消费级硬件尝试 27B 长上下文模型的爱好者
- 能自行加内容过滤并接受无审查输出的研究与创作人员
典型使用场景
- 本地长文档阅读、摘要与多轮问答
- 编程辅助与代码生成,calibration 含 llama.cpp 源码
- 日语、英文及混合语言创作与翻译
- 个人研究用途的文本生成实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
长上下文支持
原生 262K tokens 上下文窗口,适合长文档处理
混合量化策略
对 Gated-DeltaNet 敏感路径分配更高比特,兼顾体积与质量
MTP 推测解码
保留 MTP 头,可在 llama.cpp 中启用 draft-mtp 加速
无审查权重
基于移除拒绝训练的 AEON-7 BF16 派生版本
27B 参数规模
在约 11.73 GiB 文件大小下提供 27B 参数的本地推理
硬件怎么准备
- 最低约 20GB 内存或 17GB 显存可加载,但速度与上下文受限
- 推荐 24GB 内存或 19.5GB 显存以获得稳定推理体验
- 显存路径优先使用 llama.cpp 的 GPU 卸载配置
- 内存紧张时可关闭 MTP 或缩减 draft-mtp 深度
量化版本怎么选
- 仓库仅提供这 1 个 GGUF 文件,标称 3.69 bpw 混合量化
- Gated-DeltaNet 关键路径 Q4_K/Q8_0,FFN 中部 IQ2_S,注意力 Q/K/V 为 Q5_K
- MTP 张量无 imatrix,以 Q6_K 保留
- 若需更高精度,需自行寻找 BF16 或更高比特 GGUF
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载,启用 draft-mtp 可使用 MTP 推测解码
- Ollama 拉取同名仓库即可启动
- LM Studio 加载 GGUF 文件进行本地推理
- 本地服务建议绑定 127.0.0.1 而非 0.0.0.0
采用前要知道的限制
- 无内置安全层,输出可能包含不当内容,需自行加过滤
- 模型卡未提供与官方 Qwen3.8-27B 的质量对比数据
- 峰值速度仅在特定硬件上单次报告,其他设备无法保证
- 原始上游来源为 Qwen/Qwen3.8-27B,需以官方模型卡为准