下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自上游 Qwen3.8-27B 原版权重,作者仅替换为 Sharp 聊天模板并把默认思考档位从 xhigh 调回 medium,权重与 MTP nextn 头未改动。量化分两段:3 bpw 以上使用 Unsloth Dynamic 3.0 UD 系列,3 bpw 及以下使用 IST-DASLab 的 GSQ-RCO 系列,2–3 bpw 区间在 wikitext、AIME25、GPQA-Diamond、LiveCodeBench v6 上由 ISTA 测得优于同级 UD 文件。运行工具覆盖 llama.cpp、Ollama 与 LM Studio,并通过 mmproj-F16.gguf 实现视觉输入。模型卡未说明具体训练数据细节。
更适合谁
- 需要 27B 级理解力并兼顾本地推理速度的中高级用户
- 希望原生支持视觉问答与 MTP 投机解码的本地部署者
- 显存约 12–24GB 之间的单卡消费级硬件持有者
典型使用场景
- 视觉对话与图像内容问答
- 编程与 agentic coding 任务
- 知识型问答与文档理解
- 长上下文多轮对话与代码辅助
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
27B 视觉语言密度
源自 Qwen3.8-27B 的稠密 27B 视觉语言模型,权重未改
Sharp 精简模板
内置 terseness 系统提示与 Qwen 3.8 适配模板,同问答案更短
MTP 投机解码支持
保留 nextn 头,兼容运行时可直接享受推理加速
双量化器分层
UD 与 GSQ-RCO 分别覆盖高/低 bpw 区间,低比特有差异化方案
可调推理档位
支持 low、medium、xhigh 三档思考努力程度
硬件怎么准备
- 12GB 单卡可选 GSQ-RCO-IQ2_S 或 IQ3_XXS,建议 7GB 以上显存
- 16GB 单卡推荐 UD-IQ4_XS 或 GSQ-RCO-IQ3_S,建议 14GB 以上显存
- 24GB 单卡推荐 UD-Q5_K_XL,建议 19.5GB 以上显存以兼顾长上下文
- 纯 CPU 推理建议 16GB 以上内存起步,更高量化档位需 24GB 以上
量化版本怎么选
- 2–3 bpw 区间优先选 GSQ-RCO 系列,作者引用 ISTA 测量在低比特表现更稳
- 3 bpw 以上优先选 Unsloth Dynamic 3.0 UD 系列,方法在该区间已趋同
- 显存紧张选 IQ2_S/IQ3_S;追求质量选 Q5_K_XL 或 Q6_K;近无损选 Q8_K 系列
- 拉取时必须显式指定量化标签,避免 llama.cpp 回退到错误文件
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| Q3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 通过 -hf 仓库 ID 加 :量化标签 拉取,模板自动生效
- Ollama 与 LM Studio 已声明兼容,可使用同标签直接加载
- 视觉任务保留仓库内 mmproj-F16.gguf,无需重复下载
- 接入编程 agent 时为 llama-server 加上 --reasoning-format deepseek
采用前要知道的限制
- 模型卡未提供训练数据与许可证以外的细节
- 默认推理档位为 medium,复杂推理需手动设置 reasoning_effort
- 8-bit 与 Q6_K_XL 系列约需 31.5GB 以上显存,普通消费卡难以容纳
- 与同作者 Dagger、Nail、TielCoder 相比,长会话与高速场景并非最优