下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
未声明
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,这是基于Qwen3.6-27B(Qwen Team, 2026)微调的视觉语言模型,通过token-efficient训练使平均思考token减少约50%而保持原答案质量与风格,支持图像输入的多模态推理;模型卡未明确说明上下文长度、具体架构和许可证。量化仓库提供Q4_K_M、Q6_K、Q8_0和f16四种GGUF文本变体及配套mmproj视觉投影器。运行工具支持llama.cpp(含MTP自投机解码加速)、Ollama、LM Studio和Jan等,LM Studio会自动识别mmproj并启用图像输入按钮。
更适合谁
- 本地部署27B级别视觉语言模型并希望压缩响应时长的用户
- 拥有16GB以上显存或24GB以上内存、希望跑通图文问答的开发者
- 需要在离线或私有环境完成多模态推理任务的研究者
- 想对比不同量化档位在准确率与体积之间取舍的评估者
典型使用场景
- 本地图文问答与多模态对话
- 需要思维链的复杂推理任务,例如数学与代码问题
- 离线环境下的视觉理解与文档图像分析
- 评估不同量化档位与MTP加速对速度的影响
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
思考token效率
通过微调使平均思考token减少约50%,保持原答案质量与风格
视觉语言能力
原生支持图像输入,结合mmproj可进行图文多模态推理
量化近无损
f16、Q8_0、Q6_K、Q4_K_M在MMLU-Pro与RealWorldQA上准确率统计上无显著差异
MTP自投机解码
支持llama.cpp的MTP自投机解码,无需额外draft模型即可加速
多工具兼容
同时适配llama.cpp、Ollama、LM Studio、Jan等本地推理工具
硬件怎么准备
- Q4_K_M:最低16GB内存或14GB显存,推荐19GB内存或16GB显存
- Q6_K:最低24GB内存或20.5GB显存,推荐28.5GB内存或23.5GB显存
- Q8_0:最低31.5GB内存或27.5GB显存,推荐38GB内存或31.5GB显存
- f16:模型卡未提供与50.9GB文件大小一致的明确最低硬件门槛,建议显存充裕时再考虑
量化版本怎么选
- 多数本地场景推荐Q4_K_M,是模型卡建议的尺寸与质量平衡点
- 追求近无损可考虑Q8_0或Q6_K,显存充裕时优先
- f16为未量化源权重,体积最大,硬件门槛最高
- 速度敏感场景建议Q4_K_M配合MTP自投机解码
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp CLI或llama-server,支持--mmproj与--spec-type draft-mtp
- Ollama本地推理
- LM Studio本地加载,自动识别mmproj启用图像按钮
- Jan等兼容llama.cpp的桌面推理工具
采用前要知道的限制
- 模型卡未提供明确的上下文长度、架构类型和许可证信息
- f16变体在README标注为50.9GB,仓库元数据给出的体积与硬件估算与之不一致,需自行确认
- 27B规模对消费级硬件仍有较高门槛,低显存设备难以流畅运行
- 思考token减少对部分需要更长探索链的任务表现影响,模型卡未做相关说明