← 返回模型库

unsloth/Qwen3.6-35B-A3B-MTP-GGUF

Qwen3.6-35B-A3B-MTP-GGUF:面向智能体编码的多模态MoE

这是Qwen3.6-35B-A3B的多token预测GGUF量化版,总参数35B、激活约3B,原生26.2万token上下文并可扩展至约101万。模型具备视觉编码与智能体编码能力,强调工具调用与思考上下文保留。适合本地部署智能体助手或多模态应用的进阶用户,最低IQ1_M可在约4.

智能体编码多模态长上下文
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库由unsloth发布,仅封装Qwen3.6-35B-A3B模型的GGUF量化权重与配置文件,并支持多token预测加速。模型卡显示该模型属于多模态因果语言模型,含视觉编码器,主打智能体编码、工具调用和思考上下文保留。仓库本身不含训练数据与训练细节,推理效率与吞吐依赖所选框架。量化档位覆盖IQ1到Q6及BF16等;本地可通过llama.cpp、Ollama或LM Studio运行,服务端可通过SGLang、vLLM、KTransformers等部署OpenAI兼容API。

更适合谁

  • 需要本地部署智能体编码助手的开发者
  • 关注长上下文与多模态理解的进阶用户
  • 希望尝试MoE+MTP推理加速方案的爱好者
  • 隐私敏感场景下的本地大模型使用者

典型使用场景

  • 仓库级代码理解与前端工作流自动化
  • 工具调用与多步骤智能体任务
  • 图像、文档与视频理解类多模态问答
  • 超长文档摘要与多轮上下文推理

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

智能体编码

模型卡强调前端工作流与仓库级推理能力提升

长上下文支持

原生26.2万token,可扩展至约101万

多token预测

MTP加速,模型卡声称约1.5至2倍推理提升

多模态能力

含视觉编码器,支持图文与视频理解

MoE高效推理

35B总参数仅激活约3B

硬件怎么准备

  • IQ1_M最低约4.5GB显存或5.5GB内存可用
  • Q2_K_XL/IQ2_M最低约9GB显存或10.5GB内存
  • Q4_K_M/IQ4_NL最低约18GB显存或20.5GB内存
  • Q6_K最低约26.5GB显存或31GB内存

量化版本怎么选

  • 显存紧张可选IQ2_M或Q2_K_XL
  • 平衡质量与体积推荐Q4_K_M或IQ4_NL
  • 接近原精度可选Q5_K_M或BF16
  • 模型卡建议至少保持128K上下文以保留思考能力

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ14.1 GB4.5 GB5.5 GB8 GB文件 ↗
IQ28.1 GB9 GB10.5 GB12.5 GB文件 ↗
Q28.1 GB9 GB10.5 GB12.5 GB文件 ↗
IQ312 GB13.5 GB15.5 GB18.5 GB文件 ↗
Q312 GB13.5 GB15.5 GB18.5 GB文件 ↗
IQ416 GB18 GB20.5 GB24.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 通过llama.cpp本地运行,CPU需设GGML_CUDA=OFF
  • 通过Ollama或LM Studio一键加载
  • 通过SGLang或vLLM部署OpenAI兼容API
  • 通过Unsloth Studio自动配置MTP参数

采用前要知道的限制

  • 模型卡未提供完整训练数据说明
  • MTP模式尚不支持多并行与mmproj
  • 不支持Qwen3风格的/think与/nothink软切换
  • 超长上下文对显存需求显著