下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
仓库能力来自基础模型 Qwen3.8-27B(混合 Gated-DeltaNet + Gated Attention 架构,64 层由 16 组「3 GatedDeltaNet + 1 GatedAttn」循环构成),原生 262k 上下文并可经 YaRN 扩展到 1M,由 Qwen 团队发布,本仓库仅做量化分发。量化策略专门针对 GDN 状态(ssm_alpha/ssm_beta)保持 Q8_0、混频器使用 Q4_K、MTP 草稿头为 Q6_K,与普通 2-bit 平铺量化相比更注重混合架构敏感路径。运行工具方面,文件面向 llama.
更适合谁
- 拥有 16–24 GB 显存显卡、希望本地运行 27B 多模态模型的用户
- 愿意使用 llama.cpp / Ollama / LM Studio 等 GGUF 运行时的进阶用户
- 需要长上下文或 YaRN 1M 扩展、且关注 MTP 草稿加速的推理场景用户
典型使用场景
- 中文长文档阅读、摘要与多轮问答
- 启用 mmproj 后的图像理解与图文对话
- 需要思维链的代码辅助、工具调用与推理任务
- 在 16–24 GB 显卡上本地部署 27B 多模态模型
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
Gated-DeltaNet 感知量化
GDN 状态路径保持 Q8_0、混频器 Q4_K,针对混合架构敏感路径定制,避免普通 IQ2/IQ3 在 GDN 上的失效
原生 MTP 草稿头保留
推测解码头在文件内,支持 draft-mtp 的运行时可获加速,不支持时仍按普通 27B 运行
多模态与长上下文
可选 BF16 mmproj 启用图像输入;原生 262k 窗口,可经 YaRN 扩展到 1M 上下文
中英双语与工具调用
基础模型支持中英文以及工具调用模板,适合中文推理与工具调用场景
硬件怎么准备
- 16 GB 显存显卡可作为 Ridge-3.7bpw 文本推理的入门配置
- 24 GB 显存显卡在加入 KV 缓存与可选 mmproj 后更舒适
- 长上下文(接近 262k 或 1M YaRN)下 KV 缓存占主导,需留意显存或内存卸载
- 纯文本最小 RAM 约 20 GB,建议 RAM 24 GB
量化版本怎么选
- 文本推理下载 Ridge-3.7bpw 主文件即可,约 11.73 GiB
- 启用图像输入需额外下载 mmproj-Qwen3.8-27B-BF16 视觉编码文件,约 0.87 GiB
- 不要对 blk.64 MTP 张量使用 IQ2/IQ3,会触发 imatrix 缺失导致中止
- 仓库仅提供此一种 Ridge 混合量化文件,更低或更高精度文件未提供
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp 文本与多模态:llama-cli / llama-server / llama-mtmd-cli
- Ollama 通过 Modelfile 或直接拉取运行
- LM Studio、jan、KoboldCpp 直接加载 GGUF 文件
- 启用 MTP 加速需选用支持 draft-mtp 的较新 llama.cpp 构建
采用前要知道的限制
- 非无损:相比同源 BF16 转换版 wiki-style 困惑度上升约 9.3%
- 上下文以 KV 缓存为主要显存开销,长上下文下需谨慎设置
- MTP 加速依赖运行时支持,老版本 llama.cpp 不会自动启用
- 模型卡未说明独立的安全、对齐与下游任务评测结论