← 返回模型库

unsloth/Qwen3.6-35B-A3B-GGUF

Qwen3.6-35B-A3B-GGUF:35B 多模态代理编程与长文档模型

Qwen3.6-35B-A3B 是千问首个开源权重的 35B 多模态 MoE 大模型,总参数 35B、激活 3B,支持文本、图像与视频输入,原生 26 万 token 上下文可扩展至百万级。模型卡强调智能体编码、工具调用与思维链保留能力。适合需要本地代理编程、长文档问答和视觉理解的开发者与研究者。可通过 llama.

多模态大模型长上下文智能体编程工具调用
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本模型为 Qwen3.6-35B-A3B,Qwen3.6 系列首个开源权重版本,模型卡来自原始团队而非社区微调。能力方面强调原生 MoE 架构(256 专家,每 token 激活 8+1)、Agentic Coding、Tool Calling、保留思考链的 thinking 模式,以及支持约 1M token 扩展的多模态长上下文。本仓库为 unsloth 维护的 GGUF 量化镜像,提供 IQ1 至 Q6、BF16、MXFP4_MOE 等量化文件,BF16 拆分为两卷。运行侧官方覆盖 llama.cpp、Ollama、LM Studio、vLLM、SGLang、KTransformers。

更适合谁

  • 需要本地大上下文编码与代理工作流的开发者
  • 关注图像、视频理解与长文档问答的研究者
  • 显存有限但希望尝试 35B 级 MoE 模型的本地用户

典型使用场景

  • 仓库级代码理解与多文件编辑的智能体助手
  • 长篇论文、合同或日志的摘要与问答
  • 图像、文档截图与视频帧的多模态问答
  • 通过 MCP 或 Qwen-Agent 搭建工具调用应用

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

MoE 高效激活

总参数 35B 但每 token 仅激活 3B,长上下文推理显存占用相对可控

智能体编程能力

模型卡强调 Agentic Coding、仓库级代码任务与 SWE-bench 等基准

思维链保留

新增 preserve_thinking 选项,可在多轮对话中保留推理上下文

原生长上下文

默认 262144 tokens,可扩展至约 1010000 tokens,适合长文档处理

多模态视觉理解

自带视觉编码器,支持图像与视频输入及 MMMU、VideoMME 等基准

硬件怎么准备

  • IQ1_S 约 4.4GB,估算最低 5.5GB RAM 或 4.5GB VRAM,推荐 8GB RAM / 5.5GB VRAM,适合低端设备试玩
  • IQ2/Q2 至 IQ3/Q3 系列约 8.8–13.1GB,推荐 12.5–18.5GB RAM 或 10.5–15.5GB VRAM,适合 12–16GB 显存消费卡
  • IQ4/Q4 系列约 17.5GB,推荐 24.5GB RAM 或 20.5GB VRAM,需 24GB 显存才能获得较完整体验
  • BF16、Q5、F16、MXFP4_MOE 与 Q6 约 21.9–26.3GB,推荐 31–37GB RAM 或 26–30.5GB VRAM,建议 32GB 显存以上设备

量化版本怎么选

  • 显存紧张仅做试机可选 IQ1_S 或 IQ2_XXS,体积小但质量折损明显
  • 平衡体积与质量可选 Q3_K_M 或 IQ4_NL,是消费级硬件的常见折中点
  • 接近全精度可选 BF16 或 F16,约 21.9GB,BF16 需自行合并两卷文件
  • MoE 专用推理可关注 MXFP4_MOE 量化,面向特定硬件加速

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ14.1 GB4.5 GB5.5 GB8 GB文件 ↗
IQ28.1 GB9 GB10.5 GB12.5 GB文件 ↗
Q28.1 GB9 GB10.5 GB12.5 GB文件 ↗
IQ312 GB13.5 GB15.5 GB18.5 GB文件 ↗
Q312 GB13.5 GB15.5 GB18.5 GB文件 ↗
IQ416 GB18 GB20.5 GB24.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 通过 llama.cpp 直接加载 GGUF,并配合 mmproj-F16.gguf 启用视觉输入
  • 在 Ollama 中拉取对应量化标签进行本地对话
  • 使用 LM Studio 选择 GGUF 文件做图形化推理
  • 高吞吐场景按模型卡推荐使用 vLLM、SGLang 或 KTransformers

采用前要知道的限制

  • 模型卡未说明 IQ1 等极低比特量化的语义与代码能力损失幅度
  • BF16 全精度权重被拆为两卷文件,需自行确认合并与校验方式
  • 模型卡未承诺推理速度与首 token 时长,实际表现取决于框架与硬件
  • 1M token 扩展为可选能力,模型卡未明确该档位下的硬件与精度要求