← 返回模型库

Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF

Qwen3.8-27B-ABLITERATED-GGUF:本地多模态去拒答大模型

基于 Qwen3.8-27B 改造的 27B 参数稠密多模态 GGUF 版本,支持文本、图像、视频输入与文本输出,原生 262K 上下文。经权重级去拒答处理,保留推理与工具调用能力,内置 MTP 推测头,可选 DFlash2 加速。Q4_K_M 推荐约 16GB 显存。

多模态对话长上下文去拒答研究本地 GGUF 部署
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,Qwen3.8-27B-ABLITERATED 属于 Qwen3.8 系列的稠密混合视觉语言模型,支持文本、图像、视频输入并输出文本,原生 262K 上下文,具备推理与工具调用能力;经过权重级去拒答处理,模型卡明确说明这并非安全基线。量化仓库提供从 Q2_K 到 Q8_0 的完整 K-quant 阶梯,含 BF16 与 F16 精度版本,以及两个视觉投影文件,主量化文件内嵌 MTP 推测头,无需外挂草稿模型;可选 DFlash2 BF16 侧车支持两文件推测加速。运行工具兼容 Ollama、llama.cpp 与 LM Studio,标准嵌入 MTP 路径无需特殊构建;DFlash2 加速则需依赖 llama.cpp 拉取请求 #27342 的固定提交。模型卡未给出通用吞吐和中文场景性能数据。

更适合谁

  • 持有 16GB 以上显存或 24GB 以上内存的本地推理用户
  • 需要 262K 长上下文、图像或视频输入的进阶研究者与开发者
  • 接受并自行管理去拒答模型部署责任的工作室与个人用户
  • 希望以单文件 GGUF 简化 Ollama 或 LM Studio 部署的实践者

典型使用场景

  • 本地长文档问答、代码生成与调试、工具调用工作流
  • 图像和视频内容理解、视觉问答与多模态对话
  • 离线部署的多模态助手或研究原型,需自行配置访问与审计

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多模态原生输入

同时支持文本、图像、视频输入并生成文本,无需外加编码器

超长上下文

原生 262K 令牌窗口,适合长文档分析与多轮会话

内置 MTP 推测解码

每个主量化文件嵌入原生 MTP 头,单文件即可启用推测解码

可选 DFlash2 加速

配合 BF16 侧车在高端显卡上显著提升解码吞吐

完整量化阶梯

从 Q2_K 到 Q8_0 覆盖低内存到近 BF16 质量的全档选择

硬件怎么准备

  • 16GB 显存起步:Q4_K_M 推荐 16GB 显存或 19GB 内存,是默认推荐档位
  • 32GB 以上显存:可选 Q6_K(推荐 23.5GB 显存)或 Q8_0(推荐 31.5GB 显存)
  • 8 至 14GB 显存或 16GB 内存以下:仅适合 Q2_K 或 Q3_K_M,需权衡质量损失
  • 纯 CPU 推理:llama.cpp `-ngl 0` 运行 Q4_K_M 建议预留 19GB 内存并注意上下文开销

量化版本怎么选

  • 默认推荐 Q4_K_M:体积与质量平衡点,支持内嵌 MTP 与可选 DFlash2
  • 显存紧张选 Q3_K_M 或 Q2_K,文件更小但质量损失明显
  • 追求近 BF16 表现选 Q6_K 或 Q8_0,分别约 23.5GB 与 31.5GB 推荐显存
  • 启用 DFlash2 需额外部署 BF16 侧车文件,仅在 96GB 级别显卡上验证

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • Ollama 或 LM Studio 直接加载对应 GGUF,一键启动纯文本或多模态会话
  • llama.cpp `llama-server` 启动 OpenAI 兼容 API,支持纯文本与视觉投影
  • 启用内嵌 MTP:标准 llama.cpp 构建即可,禁用 `--spec-draft-model`
  • 启用 DFlash2:需拉取 llama.cpp 提交 `1deefcca395743049c3820ab8f9b15043f3e9446` 的实验性构建

采用前要知道的限制

  • 模型卡明确标注为研究性去拒答改造,不属于安全基线,不应作为生产安全产品
  • DFlash2 加速仅在固定提交的实验性构建中验证,标准运行时不一定可用
  • WikiText-2 困惑度来自父模型与 NVFP4 衍生件,并非每个 GGUF 量化的实测分数
  • 长上下文实际可用长度受显存、内存与并发量影响,262K 为架构上限