下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,Qwen3.8-27B-ABLITERATED 属于 Qwen3.8 系列的稠密混合视觉语言模型,支持文本、图像、视频输入并输出文本,原生 262K 上下文,具备推理与工具调用能力;经过权重级去拒答处理,模型卡明确说明这并非安全基线。量化仓库提供从 Q2_K 到 Q8_0 的完整 K-quant 阶梯,含 BF16 与 F16 精度版本,以及两个视觉投影文件,主量化文件内嵌 MTP 推测头,无需外挂草稿模型;可选 DFlash2 BF16 侧车支持两文件推测加速。运行工具兼容 Ollama、llama.cpp 与 LM Studio,标准嵌入 MTP 路径无需特殊构建;DFlash2 加速则需依赖 llama.cpp 拉取请求 #27342 的固定提交。模型卡未给出通用吞吐和中文场景性能数据。
更适合谁
- 持有 16GB 以上显存或 24GB 以上内存的本地推理用户
- 需要 262K 长上下文、图像或视频输入的进阶研究者与开发者
- 接受并自行管理去拒答模型部署责任的工作室与个人用户
- 希望以单文件 GGUF 简化 Ollama 或 LM Studio 部署的实践者
典型使用场景
- 本地长文档问答、代码生成与调试、工具调用工作流
- 图像和视频内容理解、视觉问答与多模态对话
- 离线部署的多模态助手或研究原型,需自行配置访问与审计
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态原生输入
同时支持文本、图像、视频输入并生成文本,无需外加编码器
超长上下文
原生 262K 令牌窗口,适合长文档分析与多轮会话
内置 MTP 推测解码
每个主量化文件嵌入原生 MTP 头,单文件即可启用推测解码
可选 DFlash2 加速
配合 BF16 侧车在高端显卡上显著提升解码吞吐
完整量化阶梯
从 Q2_K 到 Q8_0 覆盖低内存到近 BF16 质量的全档选择
硬件怎么准备
- 16GB 显存起步:Q4_K_M 推荐 16GB 显存或 19GB 内存,是默认推荐档位
- 32GB 以上显存:可选 Q6_K(推荐 23.5GB 显存)或 Q8_0(推荐 31.5GB 显存)
- 8 至 14GB 显存或 16GB 内存以下:仅适合 Q2_K 或 Q3_K_M,需权衡质量损失
- 纯 CPU 推理:llama.cpp `-ngl 0` 运行 Q4_K_M 建议预留 19GB 内存并注意上下文开销
量化版本怎么选
- 默认推荐 Q4_K_M:体积与质量平衡点,支持内嵌 MTP 与可选 DFlash2
- 显存紧张选 Q3_K_M 或 Q2_K,文件更小但质量损失明显
- 追求近 BF16 表现选 Q6_K 或 Q8_0,分别约 23.5GB 与 31.5GB 推荐显存
- 启用 DFlash2 需额外部署 BF16 侧车文件,仅在 96GB 级别显卡上验证
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- Ollama 或 LM Studio 直接加载对应 GGUF,一键启动纯文本或多模态会话
- llama.cpp `llama-server` 启动 OpenAI 兼容 API,支持纯文本与视觉投影
- 启用内嵌 MTP:标准 llama.cpp 构建即可,禁用 `--spec-draft-model`
- 启用 DFlash2:需拉取 llama.cpp 提交 `1deefcca395743049c3820ab8f9b15043f3e9446` 的实验性构建
采用前要知道的限制
- 模型卡明确标注为研究性去拒答改造,不属于安全基线,不应作为生产安全产品
- DFlash2 加速仅在固定提交的实验性构建中验证,标准运行时不一定可用
- WikiText-2 困惑度来自父模型与 NVFP4 衍生件,并非每个 GGUF 量化的实测分数
- 长上下文实际可用长度受显存、内存与并发量影响,262K 为架构上限