← 返回模型库

peculiar-ragdoll/Nail-Qwen3.6-35B-A3B-GGUF-MTP

Nail-Qwen3.6-35B-A3B-GGUF-MTP:MTP加速的35B多模态推理模型

基于 Qwen3.6-35B-A3B 的 GGUF 量化版,保留 MTP 推测解码头并内置改良 chat template 与系统提示,支持中英双语、原生 262K 长上下文与视觉输入,主打 agentic 编程、多轮对话与复杂推理。最低 IQ3_S 需约 15.5GB 显存,BF16 双分片需 96GB+ 内存。

多模态MoE长上下文Agentic编程推测解码
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来源于 Qwen3.6-35B-A3B 基础模型:35B 总参数、约 3.4B 激活的 MoE 架构,原生 262K 上下文,支持中英双语与视觉输入,主打 agentic 软件工程、多轮对话与高效推理;模型卡未说明具体训练数据与详细基准。本仓库是 Unsloth 团队的 UD 动态量化 GGUF 分发,由作者 peculiar-ragdoll 加上 froggeric 改良的 chat template 和嵌入式系统提示;MTP 版本额外保留推测解码张量。运行工具支持 llama.cpp、Ollama、LM Studio 与 macOS 上的 MLX。

更适合谁

  • 配备 24GB+ 显卡或 32GB+ 统一内存的本地 AI 用户
  • 需要本地编程助手与 agentic 工作流的开发者
  • 想跑 262K 长上下文多轮对话的重度用户
  • 想尝试 MTP 推测解码提速的中高级玩家

典型使用场景

  • 本地 agentic 编程与代码生成
  • 长程多轮对话与文档问答
  • 视觉理解与图文问答(配合 mmproj)
  • 高吞吐的代码补全与推理任务

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

MTP 推测解码

保留 nextn 张量,README 称在 llama.cpp 源码版下代码生成约 1.25–1.35× 提速

35B MoE 体量

总参数 35B、激活约 3.4B,能力与显存/内存占用相对平衡

262K 原生长上下文

32GB Mac 上可跑到 92 轮 262k token,多轮马拉松强

改良 chat template

含 froggeric 改良版与压缩型嵌入式系统提示,工具调用与多轮更稳

多模态输入

通过 mmproj-F16.gguf 提供视觉问答能力

硬件怎么准备

  • IQ3_S:建议至少 15.5GB 显存 / 18.5GB 内存,门槛最低但 16GB 卡余量紧张
  • IQ4_XS 或 Q4_K_S:建议约 20.5GB 显存 / 24.5GB 内存,24GB 显卡常用档
  • Q5_K_XL 或 Q6_K_XL:建议约 26–30.5GB 显存 / 31–37GB 内存,需 32GB+ 显存或统一内存
  • BF16 双分片:单分片约 21.9GB,合计约 71GB,需 96GB+ 整机内存

量化版本怎么选

  • 16GB 显卡勉强上 IQ3_S,长上下文空间受限
  • 24GB 显卡优先 IQ4_XS,长上下文与 KV cache 余量更好
  • 想用 Q4 档位最高保真选 Q4_K_S,但 24GB 余量偏紧
  • 32GB+ 显存或统一内存可上 Q5_K_XL 或 Q6_K_XL;BF16 仅在 96GB+ 机器考虑

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ312 GB13.5 GB15.5 GB18.5 GB文件 ↗
IQ416 GB18 GB20.5 GB24.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp 源码版 b10362+ 启用 MTP 推测解码:使用 --spec-type draft-mtp
  • Ollama 或 LM Studio 直接加载 GGUF(不带 MTP 加速)
  • macOS MLX / oMLX 同一权重不同格式
  • 视觉能力需额外加载 mmproj-F16.gguf,使用 llama-mtmd-cli

采用前要知道的限制

  • README 全部基准来自 MLX 构建,非本 GGUF 实测
  • 系统提示硬编码在 chat template,无法通过 API 关闭
  • 当前 llama.cpp 正式版尚未支持 MTP 加速,需源码编译
  • 量化由 Unsloth 完成,本仓库只改了 metadata,质量由 UD 方案决定