← 返回模型库

esatapedico/Qwen3.8-27B-NVFP4-MTP-GGUF

Qwen3.8-27B-NVFP4-MTP-GGUF:多模态长上下文九档量化

这是 Qwen3.8-27B 原生视觉语言模型的 GGUF 多档位量化合集,主干采用 NVFP4 格式并嵌入 MTP 推测解码头,原生支持 262K 长上下文与图像视频识别。适合想在单张或双张 16 GB Blackwell 显卡上跑 27B 多模态模型的开发者和长上下文研究者。

多模态视觉语言模型27B 长上下文NVFP4 Blackwell 量化MTP 推测解码
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型本体是 27B 参数稠密视觉语言模型,采用 Gated DeltaNet 与 Gated Attention 混合结构,由 Qwen 团队开源、Unsloth 提供 NVFP4 预量化源权重。本仓库负责 GGUF 转换与分档切片,把 NVFP4 主干拆成九档精度梯度,覆盖 14.86 GB 到 33.13 GB 区间,每档都内嵌 MTP 草稿头无需外挂。本档位针对 Blackwell sm_120 优化,运行端需 llama.cpp、Ollama 或 LM Studio,开启推测解码须在 llama.cpp 中指定 draft-mtp 模式。模型卡未给出统一基准测试,仅附非正式单次运行观察,不可作为速度或质量承诺。

更适合谁

  • 在 Blackwell 显卡上尝试 27B 多模态模型本地推理的开发者
  • 需要 262K 长上下文并兼顾图像视频理解的实验者
  • 想对比 NVFP4、Q8_0、BF16 三档精度与体积权衡的研究者
  • 拥有双 16 GB Blackwell 显卡、希望按精度挑选分档的用户

典型使用场景

  • 图像和视频内容问答与描述生成
  • 超长文档摘要与代码理解(最高 262K token)
  • 多模态 RAG 与视觉智能体原型
  • 本地 27B 模型量化精度对比实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

原生 NVFP4 主干

448 个张量使用 NVFP4 量化,针对 Blackwell sm_120 优化

内置 MTP 草稿头

每档都嵌入多 token 预测草稿块,无需外挂 drafter

长上下文与多模态

262K 原生上下文,视觉与视频识别原生支持

九档精度梯度

从 14.86 GB 到 33.13 GB 共九档大小与精度组合

硬件怎么准备

  • COMPACT-LOW 官方列出最低 20 GB 内存、17 GB 显存,推荐 24 GB 内存、19.5 GB 显存
  • 其它档位官方未列出明确门槛;双 16 GB Blackwell 可跑全部档位
  • HIGHEST 与 ORIG 体积更大,单卡 16 GB 难以承载大 KV 缓存,官方未给具体上下文上限
  • 16 GB 单卡用户可改用同作者的 BUDGET/STARVED 极小档版本

量化版本怎么选

  • 体积紧张选 VERY-LOW 或 COMPACT-LOW(14.86–15.16 GB),注意力有精度损失
  • 兼顾体积与精度选 MEDIUM 或 MID-HIGH(16.38–16.90 GB),头部升到 Q8_0
  • 接近源模型选 HIGHEST(23.19 GB),注意力 Q8_0、嵌入 BF16
  • 极致保真选 ORIG(33.13 GB),注意力与头部均为 BF16

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
BF1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp:启用 --spec-type draft-mtp 调用 MTP 推测解码,--mmproj 加载视觉投影器
  • Ollama:原生支持,无需额外草稿文件
  • LM Studio:可加载 GGUF 并提供图形界面
  • Blackwell 用户建议开启 flash attention 与量化 KV 缓存

采用前要知道的限制

  • 紧凑档注意力被二次量化(F8→BF16→NVFP4),相比源模型有精度损失
  • HIGHEST 与 ORIG 在 16 GB 单卡上无法承载大 KV 缓存,官方未给具体上下文上限
  • 模型卡未提供正式基准,仅有非正式单次运行观察,不可作为速度或质量承诺
  • NVFP4 针对 Blackwell sm_120 优化,其他架构兼容性与加速效果模型卡未说明