下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型本体是 27B 参数稠密视觉语言模型,采用 Gated DeltaNet 与 Gated Attention 混合结构,由 Qwen 团队开源、Unsloth 提供 NVFP4 预量化源权重。本仓库负责 GGUF 转换与分档切片,把 NVFP4 主干拆成九档精度梯度,覆盖 14.86 GB 到 33.13 GB 区间,每档都内嵌 MTP 草稿头无需外挂。本档位针对 Blackwell sm_120 优化,运行端需 llama.cpp、Ollama 或 LM Studio,开启推测解码须在 llama.cpp 中指定 draft-mtp 模式。模型卡未给出统一基准测试,仅附非正式单次运行观察,不可作为速度或质量承诺。
更适合谁
- 在 Blackwell 显卡上尝试 27B 多模态模型本地推理的开发者
- 需要 262K 长上下文并兼顾图像视频理解的实验者
- 想对比 NVFP4、Q8_0、BF16 三档精度与体积权衡的研究者
- 拥有双 16 GB Blackwell 显卡、希望按精度挑选分档的用户
典型使用场景
- 图像和视频内容问答与描述生成
- 超长文档摘要与代码理解(最高 262K token)
- 多模态 RAG 与视觉智能体原型
- 本地 27B 模型量化精度对比实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
原生 NVFP4 主干
448 个张量使用 NVFP4 量化,针对 Blackwell sm_120 优化
内置 MTP 草稿头
每档都嵌入多 token 预测草稿块,无需外挂 drafter
长上下文与多模态
262K 原生上下文,视觉与视频识别原生支持
九档精度梯度
从 14.86 GB 到 33.13 GB 共九档大小与精度组合
硬件怎么准备
- COMPACT-LOW 官方列出最低 20 GB 内存、17 GB 显存,推荐 24 GB 内存、19.5 GB 显存
- 其它档位官方未列出明确门槛;双 16 GB Blackwell 可跑全部档位
- HIGHEST 与 ORIG 体积更大,单卡 16 GB 难以承载大 KV 缓存,官方未给具体上下文上限
- 16 GB 单卡用户可改用同作者的 BUDGET/STARVED 极小档版本
量化版本怎么选
- 体积紧张选 VERY-LOW 或 COMPACT-LOW(14.86–15.16 GB),注意力有精度损失
- 兼顾体积与精度选 MEDIUM 或 MID-HIGH(16.38–16.90 GB),头部升到 Q8_0
- 接近源模型选 HIGHEST(23.19 GB),注意力 Q8_0、嵌入 BF16
- 极致保真选 ORIG(33.13 GB),注意力与头部均为 BF16
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp:启用 --spec-type draft-mtp 调用 MTP 推测解码,--mmproj 加载视觉投影器
- Ollama:原生支持,无需额外草稿文件
- LM Studio:可加载 GGUF 并提供图形界面
- Blackwell 用户建议开启 flash attention 与量化 KV 缓存
采用前要知道的限制
- 紧凑档注意力被二次量化(F8→BF16→NVFP4),相比源模型有精度损失
- HIGHEST 与 ORIG 在 16 GB 单卡上无法承载大 KV 缓存,官方未给具体上下文上限
- 模型卡未提供正式基准,仅有非正式单次运行观察,不可作为速度或质量承诺
- NVFP4 针对 Blackwell sm_120 优化,其他架构兼容性与加速效果模型卡未说明