← 返回模型库

peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF

Dirk-Qwen3.8-27B-GGUF:精简模板默认的27B视觉语言模型

Dirk 是基于 Qwen3.8-27B 的 27B 视觉语言 GGUF 量化版本,原生支持图像输入并保留 MTP 多 token 预测投机解码头,推理档位可在 low、medium、xhigh 间切换,适合需要在消费级显卡上做代码、视觉问答和知识型任务的中高级本地用户。

视觉语言模型27B 本地推理代码与编程助手GGUF 量化
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自上游 Qwen3.8-27B 原版权重,作者仅替换为 Sharp 聊天模板并把默认思考档位从 xhigh 调回 medium,权重与 MTP nextn 头未改动。量化分两段:3 bpw 以上使用 Unsloth Dynamic 3.0 UD 系列,3 bpw 及以下使用 IST-DASLab 的 GSQ-RCO 系列,2–3 bpw 区间在 wikitext、AIME25、GPQA-Diamond、LiveCodeBench v6 上由 ISTA 测得优于同级 UD 文件。运行工具覆盖 llama.cpp、Ollama 与 LM Studio,并通过 mmproj-F16.gguf 实现视觉输入。模型卡未说明具体训练数据细节。

更适合谁

  • 需要 27B 级理解力并兼顾本地推理速度的中高级用户
  • 希望原生支持视觉问答与 MTP 投机解码的本地部署者
  • 显存约 12–24GB 之间的单卡消费级硬件持有者

典型使用场景

  • 视觉对话与图像内容问答
  • 编程与 agentic coding 任务
  • 知识型问答与文档理解
  • 长上下文多轮对话与代码辅助

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

27B 视觉语言密度

源自 Qwen3.8-27B 的稠密 27B 视觉语言模型,权重未改

Sharp 精简模板

内置 terseness 系统提示与 Qwen 3.8 适配模板,同问答案更短

MTP 投机解码支持

保留 nextn 头,兼容运行时可直接享受推理加速

双量化器分层

UD 与 GSQ-RCO 分别覆盖高/低 bpw 区间,低比特有差异化方案

可调推理档位

支持 low、medium、xhigh 三档思考努力程度

硬件怎么准备

  • 12GB 单卡可选 GSQ-RCO-IQ2_S 或 IQ3_XXS,建议 7GB 以上显存
  • 16GB 单卡推荐 UD-IQ4_XS 或 GSQ-RCO-IQ3_S,建议 14GB 以上显存
  • 24GB 单卡推荐 UD-Q5_K_XL,建议 19.5GB 以上显存以兼顾长上下文
  • 纯 CPU 推理建议 16GB 以上内存起步,更高量化档位需 24GB 以上

量化版本怎么选

  • 2–3 bpw 区间优先选 GSQ-RCO 系列,作者引用 ISTA 测量在低比特表现更稳
  • 3 bpw 以上优先选 Unsloth Dynamic 3.0 UD 系列,方法在该区间已趋同
  • 显存紧张选 IQ2_S/IQ3_S;追求质量选 Q5_K_XL 或 Q6_K;近无损选 Q8_K 系列
  • 拉取时必须显式指定量化标签,避免 llama.cpp 回退到错误文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 通过 -hf 仓库 ID 加 :量化标签 拉取,模板自动生效
  • Ollama 与 LM Studio 已声明兼容,可使用同标签直接加载
  • 视觉任务保留仓库内 mmproj-F16.gguf,无需重复下载
  • 接入编程 agent 时为 llama-server 加上 --reasoning-format deepseek

采用前要知道的限制

  • 模型卡未提供训练数据与许可证以外的细节
  • 默认推理档位为 medium,复杂推理需手动设置 reasoning_effort
  • 8-bit 与 Q6_K_XL 系列约需 31.5GB 以上显存,普通消费卡难以容纳
  • 与同作者 Dagger、Nail、TielCoder 相比,长会话与高速场景并非最优