下载量
0
参数
27B
上下文
未说明
架构 / 任务
qwen3_5
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型本身为 Qwen3.8-27B,由 Qwen 基于 Qwen3.5 架构构建的 27B 密集参数视觉语言模型,原生支持图像、视频与超长文本理解,并内置 MTP 多 token 预测与可调节的思考开关;编码、代理规划、工具调用等能力说明均来自模型卡描述。量化仓库由 unsloth 维护为 GGUF 格式,自称同体积下精度优于其他供应方。运行层面同时支持 Ollama、llama.cpp 与 LM Studio 等本地推理框架,量化档位从 IQ1 到 Q6_K 及 BF16 全精度全覆盖。模型卡未说明的内容:训练数据规模与具体任务跑分。
更适合谁
- 需要本地部署 27B 规模的多模态项目开发者
- 希望在单卡或双卡消费级显卡上跑视觉语言模型的用户
- 从事长文档摘要、代码生成或代理式任务的研究者
- 想精细调节思考深度与上下文长度的进阶玩家
典型使用场景
- 代码编写与程序调试辅助
- 长篇研究报告、文档的阅读与摘要
- 图表、截图与视频内容的多模态问答
- 多轮代理式自动化任务执行
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
原生视觉语言
原生支持图像与视频理解,覆盖 STEM 图表、文档到小时级视频
超长上下文
原生 262144 tokens,可通过 YaRN 等 RoPE 扩展到 1000000 tokens
灵活思考控制
默认开启思考模式,可按请求关闭并以 reasoning_effort 调节深度
代理与工具调用
强化自主规划与环境反馈适配,支持 Codex 等代理框架
MTP 多 token 预测
模型卡注明经过多步训练,可改善生成效率
硬件怎么准备
- 8GB 内存仅够 IQ2_S 或 Q2_K_XL 等低量化版本入门
- 12GB 内存可尝试 IQ3_S 或 Q3_K_XL 量化档位
- 16GB 显存可承载 Q4_K_M 或 IQ4_XS 量化版
- 20GB 以上显存建议 Q5_K_M、Q6_K 或 BF16 全精度
量化版本怎么选
- 显存紧张时选 IQ2_S 或 Q2_K_XL 起步,但需评估质量损失
- 追求平衡可选 Q4_K_M 或 IQ4_XS,所需显存约 16GB
- 硬件充足且重视质量推荐 Q6_K 或 BF16 全精度
- 仅作功能验证可用 IQ1_M 极限压缩版本
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ1 | 3.1 GB | 3.5 GB | 4.5 GB | 8 GB | 文件 ↗ |
| Q2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载 GGUF 文件
- Ollama 拉取并运行对应模型
- LM Studio 导入 GGUF 推理
- Unsloth Desktop 提供图形界面与微调支持
采用前要知道的限制
- 模型卡未给出训练数据构成与具体基准分数
- 27B 体量在普通笔记本上仍难流畅运行高量化档位
- 视频与超长上下文场景需自行调节 longest_edge 等参数
- IQ1、IQ2 等极低量化版本质量损失较大,需实测取舍