下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库是 unsloth 维护的 GGUF 量化镜像,转发基础模型 Qwen/Qwen3.6-27B 的多模态权重,覆盖 IQ2 到 Q8 共十余种量化方案,并附带 mmproj-F16/F32 视觉投影。模型能力来自上游 Qwen3.6-27B 官方卡,强调代理式编码、前后端与仓库级推理、改进的嵌套对象工具调用、保留历史思考上下文以及原生 262K token 长上下文。仓库还提供 MTP 多 Token 预测权重以追求更高吞吐;运行端兼容 Unsloth Studio、llama.cpp、Ollama、LM Studio 等 GGUF 推理客户端,上游还推荐 sglang≥0.5.10、vLLM≥0.19.0、KTransformers 等服务框架。
更适合谁
- 想本地部署带视觉理解的多模态编码助手并能接受较高显存占用的开发者
- 需要长上下文推理、长文档或代码库分析的研究员与产品工程师
- 拥有 24GB 及以上显存或大内存工作站、希望跑 BF16/Q5 以上高质量档位的用户
- 想尝试 MTP 多 Token 预测以追求更高吞吐的自部署用户
典型使用场景
- 本地部署的代码助手与仓库级代码理解问答
- 长文档、论文或大型代码库的检索式问答与摘要
- 多模态图文问答与视频内容理解解析
- 配合 Qwen-Agent 或 Qwen Code 搭建工具调用与脚本自动化
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态视觉理解
内置视觉编码器与 mmproj 文件,支持图文输入与视频理解
代理式编码能力
官方强调前后端工作流与仓库级代码推理,适合智能体编码
工具调用与解析
改善嵌套对象解析,提升函数调用成功率,适合 Agent 场景
超长上下文
原生 262K token 上下文,可经 RoPE/YaRN 扩展到约 100 万 token
MTP 加速
仓库提供多 Token 预测权重,官方宣称推理速度提升约 1.5–2 倍
硬件怎么准备
- 仅做轻量文字推理且接受质量妥协:IQ2/Q2 量化约需 8GB 内存,文件约 6.75GB,适合入门级 CPU 或集显机器
- 兼顾质量与显存:Q4/IQ4 约需 16GB 内存与 14GB 显存,适合消费级 16GB 显卡
- 高质量档位:Q5/BF16 约需 20GB 内存与 17GB 显存,建议 24GB 显存或以上
- 完整高质量推理或长上下文:Q6 需约 24GB 内存/20.5GB 显存,Q8 需 31.5GB 内存/27.5GB 显存,建议专业卡或工作站
量化版本怎么选
- 显存紧张且以文字对话为主,可优先选 Q4_0 或 IQ4_NL,文件约 13.5GB
- 想要更高质量且显存充裕,推荐 Q5_K_M 或 BF16,文件约 16.9GB
- 需要视觉能力时,记得同时下载对应的 mmproj-F16 或 mmproj-F32 视觉投影文件
- 模型卡未说明各档量化在视觉理解与长上下文任务上的具体质量差异
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| Q2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| Q3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 使用 Unsloth Studio 可自动设置 MTP 参数并启用对应加速
- 通过 llama.cpp 加载 GGUF,CPU/Metal 路径需关 CUDA,且 MTP 暂不支持 -np > 1 与 --mmproj
- 在 Ollama 或 LM Studio 等本地客户端直接加载 GGUF 运行
- 高吞吐部署可参考官方推荐的 sglang、vLLM、KTransformers 或 Hugging Face Transformers 服务
采用前要知道的限制
- 模型卡未提供具体的中文或多语言评测、速度与上下文表现数据
- MTP 模式在 llama.cpp 中暂不支持多并行推理与 --mmproj 参数
- 27B 参数规模对消费级显卡要求较高,BF16/Q5 以上基本需 24GB 显存
- 启用长上下文会增加显存占用,遇 OOM 需降低窗口,且建议至少保持 128K 以保留思考能力