下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
原始模型 Qwen/Qwen3.8-27B 为 28B 参数规模的多模态模型,支持文本与图像输入,并原生具备 MTP 多 token 推测解码层,可在 llama.cpp 中通过 --lookup-n-cache 等参数启用加速。本仓库由 bartowski 发布,使用 b10419 版 llama.cpp 完成 imatrix 量化,覆盖 IQ2、Q3、Q4、Q5、Q6、Q8 与 BF16 全谱系,并附带 mmproj 多模态投影文件。运行工具兼容 llama.cpp、LM Studio、koboldcpp、Jan AI、Ollama、ramalama、Text Generation Web UI 等。
更适合谁
- 持有 16GB 以上显存或 32GB 以上内存、想本地部署 27B 级多模态模型的用户
- 需要图文理解、工具调用、推测解码加速的开发者与研究者
- 追求 Q4_K_M 等中等量化以平衡显存与生成质量的中高端玩家
- 中文为主、兼顾英文应用场景的中文用户
典型使用场景
- 本地多模态问答与图文理解任务
- 中文为主的长文写作、翻译、摘要与对话
- 工具调用与函数式 agent 实验开发
- 离线代码生成与技术文档处理
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态图文输入
同时支持文本与图像输入,附带 mmproj 投影文件
MTP 推测解码
内置多 token 预测层,可在 llama.cpp 中启用加速
imatrix 全谱系量化
涵盖 IQ2 到 Q8_0 与 BF16,覆盖 7GB 到 31GB 显存需求
工具链广泛兼容
支持 llama.cpp、Ollama、LM Studio、koboldcpp 等主流工具
硬件怎么准备
- 8GB 内存或 7GB 显存起步可尝试 IQ2_M、Q2_K(文件约 6.75GB),属极限可用档
- 12GB 内存或 10.5GB 显存适合 IQ3_M、Q3_K_L(文件约 10.1GB)
- 16GB 内存或 14GB 显存适合 IQ4_NL、Q4_0(文件约 13.5GB),是常见平衡点
- 20GB 以上内存或 17GB 以上显存用户可选择 Q5_K_L、Q6_K 等更高质量档
量化版本怎么选
- 不想纠结的普通用户选择 Q4_K_M(约 17.77GB),官方推荐平衡点
- 想保留更高质量可选 Q5_K_M、Q6_K_L、Q6_K,文件 20–24GB
- 显存紧张的用户可选 IQ4_XS、IQ3_M、Q2_K 等新方法 I 类量化
- 想完全保留精度的研究场景使用 BF16 全精度文件,需 54GB 以上磁盘空间
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 命令行或 llama-server 内置 Web UI(需 b10419 或更新版本)
- LM Studio、Ollama、koboldcpp 等带图形界面的本地推理前端
- Text Generation Web UI、Jan AI、LoLLMs、Atomic Chat、ramalama 等社区前端
- 调用 MTP 推测解码需在 llama.cpp 命令中添加专用参数
采用前要知道的限制
- 模型卡未提供具体训练数据规模、上下文长度上限与基准跑分成绩
- 2-bit 系列(IQ2_M、Q2_K)质量较低,仅适合确认能跑通的极限测试
- BF16 原版需约 54GB 磁盘与 50GB 以上内存,多数家用设备无法加载
- 量化仓库不提供微调、LoRA 或其他衍生权重