← 返回模型库

unsloth/Qwen3.6-27B-MTP-GGUF

Qwen3.6-27B-MTP-GGUF:视觉多模态长上下文MTP编码模型

Qwen3.6-27B-MTP-GGUF 是 unsloth 在 Hugging Face 发布的 27B 参数多模态语言模型 GGUF 仓库,转发 Qwen3.6-27B 原生权重并附 mmproj 视觉投影文件,主打代理式编码、工具调用、原生 26 万 token 上下文与 MTP 多 Token 预测加速。

多模态大模型长上下文代码助手智能体工具调用
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库是 unsloth 维护的 GGUF 量化镜像,转发基础模型 Qwen/Qwen3.6-27B 的多模态权重,覆盖 IQ2 到 Q8 共十余种量化方案,并附带 mmproj-F16/F32 视觉投影。模型能力来自上游 Qwen3.6-27B 官方卡,强调代理式编码、前后端与仓库级推理、改进的嵌套对象工具调用、保留历史思考上下文以及原生 262K token 长上下文。仓库还提供 MTP 多 Token 预测权重以追求更高吞吐;运行端兼容 Unsloth Studio、llama.cpp、Ollama、LM Studio 等 GGUF 推理客户端,上游还推荐 sglang≥0.5.10、vLLM≥0.19.0、KTransformers 等服务框架。

更适合谁

  • 想本地部署带视觉理解的多模态编码助手并能接受较高显存占用的开发者
  • 需要长上下文推理、长文档或代码库分析的研究员与产品工程师
  • 拥有 24GB 及以上显存或大内存工作站、希望跑 BF16/Q5 以上高质量档位的用户
  • 想尝试 MTP 多 Token 预测以追求更高吞吐的自部署用户

典型使用场景

  • 本地部署的代码助手与仓库级代码理解问答
  • 长文档、论文或大型代码库的检索式问答与摘要
  • 多模态图文问答与视频内容理解解析
  • 配合 Qwen-Agent 或 Qwen Code 搭建工具调用与脚本自动化

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多模态视觉理解

内置视觉编码器与 mmproj 文件,支持图文输入与视频理解

代理式编码能力

官方强调前后端工作流与仓库级代码推理,适合智能体编码

工具调用与解析

改善嵌套对象解析,提升函数调用成功率,适合 Agent 场景

超长上下文

原生 262K token 上下文,可经 RoPE/YaRN 扩展到约 100 万 token

MTP 加速

仓库提供多 Token 预测权重,官方宣称推理速度提升约 1.5–2 倍

硬件怎么准备

  • 仅做轻量文字推理且接受质量妥协:IQ2/Q2 量化约需 8GB 内存,文件约 6.75GB,适合入门级 CPU 或集显机器
  • 兼顾质量与显存:Q4/IQ4 约需 16GB 内存与 14GB 显存,适合消费级 16GB 显卡
  • 高质量档位:Q5/BF16 约需 20GB 内存与 17GB 显存,建议 24GB 显存或以上
  • 完整高质量推理或长上下文:Q6 需约 24GB 内存/20.5GB 显存,Q8 需 31.5GB 内存/27.5GB 显存,建议专业卡或工作站

量化版本怎么选

  • 显存紧张且以文字对话为主,可优先选 Q4_0 或 IQ4_NL,文件约 13.5GB
  • 想要更高质量且显存充裕,推荐 Q5_K_M 或 BF16,文件约 16.9GB
  • 需要视觉能力时,记得同时下载对应的 mmproj-F16 或 mmproj-F32 视觉投影文件
  • 模型卡未说明各档量化在视觉理解与长上下文任务上的具体质量差异

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 使用 Unsloth Studio 可自动设置 MTP 参数并启用对应加速
  • 通过 llama.cpp 加载 GGUF,CPU/Metal 路径需关 CUDA,且 MTP 暂不支持 -np > 1 与 --mmproj
  • 在 Ollama 或 LM Studio 等本地客户端直接加载 GGUF 运行
  • 高吞吐部署可参考官方推荐的 sglang、vLLM、KTransformers 或 Hugging Face Transformers 服务

采用前要知道的限制

  • 模型卡未提供具体的中文或多语言评测、速度与上下文表现数据
  • MTP 模式在 llama.cpp 中暂不支持多并行推理与 --mmproj 参数
  • 27B 参数规模对消费级显卡要求较高,BF16/Q5 以上基本需 24GB 显存
  • 启用长上下文会增加显存占用,遇 OOM 需降低窗口,且建议至少保持 128K 以保留思考能力