下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本模型为 Qwen3.6-35B-A3B,Qwen3.6 系列首个开源权重版本,模型卡来自原始团队而非社区微调。能力方面强调原生 MoE 架构(256 专家,每 token 激活 8+1)、Agentic Coding、Tool Calling、保留思考链的 thinking 模式,以及支持约 1M token 扩展的多模态长上下文。本仓库为 unsloth 维护的 GGUF 量化镜像,提供 IQ1 至 Q6、BF16、MXFP4_MOE 等量化文件,BF16 拆分为两卷。运行侧官方覆盖 llama.cpp、Ollama、LM Studio、vLLM、SGLang、KTransformers。
更适合谁
- 需要本地大上下文编码与代理工作流的开发者
- 关注图像、视频理解与长文档问答的研究者
- 显存有限但希望尝试 35B 级 MoE 模型的本地用户
典型使用场景
- 仓库级代码理解与多文件编辑的智能体助手
- 长篇论文、合同或日志的摘要与问答
- 图像、文档截图与视频帧的多模态问答
- 通过 MCP 或 Qwen-Agent 搭建工具调用应用
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
MoE 高效激活
总参数 35B 但每 token 仅激活 3B,长上下文推理显存占用相对可控
智能体编程能力
模型卡强调 Agentic Coding、仓库级代码任务与 SWE-bench 等基准
思维链保留
新增 preserve_thinking 选项,可在多轮对话中保留推理上下文
原生长上下文
默认 262144 tokens,可扩展至约 1010000 tokens,适合长文档处理
多模态视觉理解
自带视觉编码器,支持图像与视频输入及 MMMU、VideoMME 等基准
硬件怎么准备
- IQ1_S 约 4.4GB,估算最低 5.5GB RAM 或 4.5GB VRAM,推荐 8GB RAM / 5.5GB VRAM,适合低端设备试玩
- IQ2/Q2 至 IQ3/Q3 系列约 8.8–13.1GB,推荐 12.5–18.5GB RAM 或 10.5–15.5GB VRAM,适合 12–16GB 显存消费卡
- IQ4/Q4 系列约 17.5GB,推荐 24.5GB RAM 或 20.5GB VRAM,需 24GB 显存才能获得较完整体验
- BF16、Q5、F16、MXFP4_MOE 与 Q6 约 21.9–26.3GB,推荐 31–37GB RAM 或 26–30.5GB VRAM,建议 32GB 显存以上设备
量化版本怎么选
- 显存紧张仅做试机可选 IQ1_S 或 IQ2_XXS,体积小但质量折损明显
- 平衡体积与质量可选 Q3_K_M 或 IQ4_NL,是消费级硬件的常见折中点
- 接近全精度可选 BF16 或 F16,约 21.9GB,BF16 需自行合并两卷文件
- MoE 专用推理可关注 MXFP4_MOE 量化,面向特定硬件加速
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ1 | 4.1 GB | 4.5 GB | 5.5 GB | 8 GB | 文件 ↗ |
| IQ2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| Q2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| IQ3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| Q3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| IQ4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| BF16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| GGUF | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q5 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| F16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q6 | 24 GB | 26.5 GB | 30.5 GB | 37 GB | 文件 ↗ |
| Q8 | 33 GB | 35.5 GB | 40.5 GB | 49 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 通过 llama.cpp 直接加载 GGUF,并配合 mmproj-F16.gguf 启用视觉输入
- 在 Ollama 中拉取对应量化标签进行本地对话
- 使用 LM Studio 选择 GGUF 文件做图形化推理
- 高吞吐场景按模型卡推荐使用 vLLM、SGLang 或 KTransformers
采用前要知道的限制
- 模型卡未说明 IQ1 等极低比特量化的语义与代码能力损失幅度
- BF16 全精度权重被拆为两卷文件,需自行确认合并与校验方式
- 模型卡未承诺推理速度与首 token 时长,实际表现取决于框架与硬件
- 1M token 扩展为可选能力,模型卡未明确该档位下的硬件与精度要求