← 返回模型库

empero-ai/Qwen3.8-27B-Ridge-GGUF

Qwen3.8-27B-Ridge-GGUF:原生MTP加速的多模态27B量化版

这是 Qwen3.8-27B 的 GGUF 量化仓库,主打 11.73 GiB 的 Ridge 3.69 bpw 混合精度文件,并保留原生 MTP 草稿头以支持推测解码。基础模型为支持视觉输入的多模态推理模型,原生 262k 上下文可经 YaRN 扩展到 1M。

多模态27B长上下文推理GatedDeltaNet量化MTP草稿加速
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

仓库能力来自基础模型 Qwen3.8-27B(混合 Gated-DeltaNet + Gated Attention 架构,64 层由 16 组「3 GatedDeltaNet + 1 GatedAttn」循环构成),原生 262k 上下文并可经 YaRN 扩展到 1M,由 Qwen 团队发布,本仓库仅做量化分发。量化策略专门针对 GDN 状态(ssm_alpha/ssm_beta)保持 Q8_0、混频器使用 Q4_K、MTP 草稿头为 Q6_K,与普通 2-bit 平铺量化相比更注重混合架构敏感路径。运行工具方面,文件面向 llama.

更适合谁

  • 拥有 16–24 GB 显存显卡、希望本地运行 27B 多模态模型的用户
  • 愿意使用 llama.cpp / Ollama / LM Studio 等 GGUF 运行时的进阶用户
  • 需要长上下文或 YaRN 1M 扩展、且关注 MTP 草稿加速的推理场景用户

典型使用场景

  • 中文长文档阅读、摘要与多轮问答
  • 启用 mmproj 后的图像理解与图文对话
  • 需要思维链的代码辅助、工具调用与推理任务
  • 在 16–24 GB 显卡上本地部署 27B 多模态模型

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

Gated-DeltaNet 感知量化

GDN 状态路径保持 Q8_0、混频器 Q4_K,针对混合架构敏感路径定制,避免普通 IQ2/IQ3 在 GDN 上的失效

原生 MTP 草稿头保留

推测解码头在文件内,支持 draft-mtp 的运行时可获加速,不支持时仍按普通 27B 运行

多模态与长上下文

可选 BF16 mmproj 启用图像输入;原生 262k 窗口,可经 YaRN 扩展到 1M 上下文

中英双语与工具调用

基础模型支持中英文以及工具调用模板,适合中文推理与工具调用场景

硬件怎么准备

  • 16 GB 显存显卡可作为 Ridge-3.7bpw 文本推理的入门配置
  • 24 GB 显存显卡在加入 KV 缓存与可选 mmproj 后更舒适
  • 长上下文(接近 262k 或 1M YaRN)下 KV 缓存占主导,需留意显存或内存卸载
  • 纯文本最小 RAM 约 20 GB,建议 RAM 24 GB

量化版本怎么选

  • 文本推理下载 Ridge-3.7bpw 主文件即可,约 11.73 GiB
  • 启用图像输入需额外下载 mmproj-Qwen3.8-27B-BF16 视觉编码文件,约 0.87 GiB
  • 不要对 blk.64 MTP 张量使用 IQ2/IQ3,会触发 imatrix 缺失导致中止
  • 仓库仅提供此一种 Ridge 混合量化文件,更低或更高精度文件未提供

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp 文本与多模态:llama-cli / llama-server / llama-mtmd-cli
  • Ollama 通过 Modelfile 或直接拉取运行
  • LM Studio、jan、KoboldCpp 直接加载 GGUF 文件
  • 启用 MTP 加速需选用支持 draft-mtp 的较新 llama.cpp 构建

采用前要知道的限制

  • 非无损:相比同源 BF16 转换版 wiki-style 困惑度上升约 9.3%
  • 上下文以 KV 缓存为主要显存开销,长上下文下需谨慎设置
  • MTP 加速依赖运行时支持,老版本 llama.cpp 不会自动启用
  • 模型卡未说明独立的安全、对齐与下游任务评测结论