下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,模型卡内容仅有 TODO 占位说明,唯一可依据的官方信息是 pipeline_tag 为 image-text-to-text,因此可确认其为图文多模态模型,更具体的支持模态、图像分辨率上限、中文与英文能力等细节均模型卡未说明。量化仓库方面,本仓库由 ggml-org 维护,仅做 GGUF 格式转换与多精度分发,本身不重新训练,提供 Q4_K_M、Q8_0、BF16 三档文件,硬件门槛依次升高。运行工具方面,资料确认支持 Ollama、llama.cpp 和 LM Studio 三种本地推理方式,其他推理后端与硬件加速方案模型卡未说明。
更适合谁
- 显存 16GB 以上或内存充足的本地大模型尝鲜者
- 想离线测试 Qwen3.8-27B 多模态能力的研究人员
- 需要 Apache 2.0 商用许可的中小团队与个人开发者
典型使用场景
- 本地图文对话与图像理解问答
- 在隔离或离线环境下测试 27B 级多模态模型
- 对比不同量化精度对显存占用与质量的取舍
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
图文多模态
pipeline_tag 为 image-text-to-text,可同时接收图像与文本输入
多档量化
提供 Q4_K_M、Q8_0、BF16 三种精度,覆盖低显存到高精度需求
宽松许可
采用 Apache 2.0 协议,允许商用与再分发
多后端支持
同时适配 Ollama、llama.cpp 与 LM Studio 三种主流本地推理工具
硬件怎么准备
- Q4_K_M 文件最低要求显存约 14GB 或内存约 16GB,推荐 16GB 显存
- Q8_0 文件最低要求显存约 27.5GB 或内存约 31.5GB,推荐 31.5GB 显存
- BF16 文件最低要求显存约 17GB 或内存约 20GB,推荐 19.5GB 显存
- 仅靠内存推理时,建议总内存不低于 31.5GB 以承载 Q8_0 档
量化版本怎么选
- 显存紧张优先选 Q4_K_M,文件约 13.5GB,是入门门槛最低的版本
- 显存 17GB 左右可选 BF16,文件约 16.875GB,保留较高精度
- 显存 27GB 以上可选 Q8_0,文件约 27GB,作为高保真参考
- 仓库未提供 Q2、Q3 等更激进的低精度版本可选
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。
阅读 24GB 显存选型指南 →可以怎样运行
- 使用 Ollama 拉取并运行 GGUF 权重
- 使用 llama.cpp 直接加载 GGUF 文件进行推理
- 使用 LM Studio 在桌面端加载并对话
采用前要知道的限制
- 模型卡仅含 TODO 占位,能力细节与适用边界模型卡未说明
- 仓库不包含 Q2、Q3 等更低精度 GGUF,极低显存设备难以运行
- BF16 与 Q8_0 文件对显存要求较高,普通消费级显卡可能无法加载
- 仅列出三种推理后端,其他加速方案与吞吐表现模型卡未说明