下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库由unsloth发布,仅封装Qwen3.6-35B-A3B模型的GGUF量化权重与配置文件,并支持多token预测加速。模型卡显示该模型属于多模态因果语言模型,含视觉编码器,主打智能体编码、工具调用和思考上下文保留。仓库本身不含训练数据与训练细节,推理效率与吞吐依赖所选框架。量化档位覆盖IQ1到Q6及BF16等;本地可通过llama.cpp、Ollama或LM Studio运行,服务端可通过SGLang、vLLM、KTransformers等部署OpenAI兼容API。
更适合谁
- 需要本地部署智能体编码助手的开发者
- 关注长上下文与多模态理解的进阶用户
- 希望尝试MoE+MTP推理加速方案的爱好者
- 隐私敏感场景下的本地大模型使用者
典型使用场景
- 仓库级代码理解与前端工作流自动化
- 工具调用与多步骤智能体任务
- 图像、文档与视频理解类多模态问答
- 超长文档摘要与多轮上下文推理
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
智能体编码
模型卡强调前端工作流与仓库级推理能力提升
长上下文支持
原生26.2万token,可扩展至约101万
多token预测
MTP加速,模型卡声称约1.5至2倍推理提升
多模态能力
含视觉编码器,支持图文与视频理解
MoE高效推理
35B总参数仅激活约3B
硬件怎么准备
- IQ1_M最低约4.5GB显存或5.5GB内存可用
- Q2_K_XL/IQ2_M最低约9GB显存或10.5GB内存
- Q4_K_M/IQ4_NL最低约18GB显存或20.5GB内存
- Q6_K最低约26.5GB显存或31GB内存
量化版本怎么选
- 显存紧张可选IQ2_M或Q2_K_XL
- 平衡质量与体积推荐Q4_K_M或IQ4_NL
- 接近原精度可选Q5_K_M或BF16
- 模型卡建议至少保持128K上下文以保留思考能力
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ1 | 4.1 GB | 4.5 GB | 5.5 GB | 8 GB | 文件 ↗ |
| IQ2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| Q2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| IQ3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| Q3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| IQ4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| BF16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| GGUF | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q5 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| F16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q6 | 24 GB | 26.5 GB | 30.5 GB | 37 GB | 文件 ↗ |
| Q8 | 33 GB | 35.5 GB | 40.5 GB | 49 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 通过llama.cpp本地运行,CPU需设GGML_CUDA=OFF
- 通过Ollama或LM Studio一键加载
- 通过SGLang或vLLM部署OpenAI兼容API
- 通过Unsloth Studio自动配置MTP参数
采用前要知道的限制
- 模型卡未提供完整训练数据说明
- MTP模式尚不支持多并行与mmproj
- 不支持Qwen3风格的/think与/nothink软切换
- 超长上下文对显存需求显著