← 返回模型库

bartowski/Qwen3.8-27B-GGUF

Qwen3.8-27B-GGUF:27B 多模态中文对话量化版

本仓库为 Qwen3.8-27B 的 llama.cpp GGUF 量化版本,支持中英文文本生成、图文理解、MTP 推测解码与工具调用。提供 IQ2 到 Q8_0 全套量化以及 BF16 原版,适合本地高显存用户追求质量、低显存用户追求可用。

多模态对话中文大模型27B 量化图文理解
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

原始模型 Qwen/Qwen3.8-27B 为 28B 参数规模的多模态模型,支持文本与图像输入,并原生具备 MTP 多 token 推测解码层,可在 llama.cpp 中通过 --lookup-n-cache 等参数启用加速。本仓库由 bartowski 发布,使用 b10419 版 llama.cpp 完成 imatrix 量化,覆盖 IQ2、Q3、Q4、Q5、Q6、Q8 与 BF16 全谱系,并附带 mmproj 多模态投影文件。运行工具兼容 llama.cpp、LM Studio、koboldcpp、Jan AI、Ollama、ramalama、Text Generation Web UI 等。

更适合谁

  • 持有 16GB 以上显存或 32GB 以上内存、想本地部署 27B 级多模态模型的用户
  • 需要图文理解、工具调用、推测解码加速的开发者与研究者
  • 追求 Q4_K_M 等中等量化以平衡显存与生成质量的中高端玩家
  • 中文为主、兼顾英文应用场景的中文用户

典型使用场景

  • 本地多模态问答与图文理解任务
  • 中文为主的长文写作、翻译、摘要与对话
  • 工具调用与函数式 agent 实验开发
  • 离线代码生成与技术文档处理

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多模态图文输入

同时支持文本与图像输入,附带 mmproj 投影文件

MTP 推测解码

内置多 token 预测层,可在 llama.cpp 中启用加速

imatrix 全谱系量化

涵盖 IQ2 到 Q8_0 与 BF16,覆盖 7GB 到 31GB 显存需求

工具链广泛兼容

支持 llama.cpp、Ollama、LM Studio、koboldcpp 等主流工具

硬件怎么准备

  • 8GB 内存或 7GB 显存起步可尝试 IQ2_M、Q2_K(文件约 6.75GB),属极限可用档
  • 12GB 内存或 10.5GB 显存适合 IQ3_M、Q3_K_L(文件约 10.1GB)
  • 16GB 内存或 14GB 显存适合 IQ4_NL、Q4_0(文件约 13.5GB),是常见平衡点
  • 20GB 以上内存或 17GB 以上显存用户可选择 Q5_K_L、Q6_K 等更高质量档

量化版本怎么选

  • 不想纠结的普通用户选择 Q4_K_M(约 17.77GB),官方推荐平衡点
  • 想保留更高质量可选 Q5_K_M、Q6_K_L、Q6_K,文件 20–24GB
  • 显存紧张的用户可选 IQ4_XS、IQ3_M、Q2_K 等新方法 I 类量化
  • 想完全保留精度的研究场景使用 BF16 全精度文件,需 54GB 以上磁盘空间

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 命令行或 llama-server 内置 Web UI(需 b10419 或更新版本)
  • LM Studio、Ollama、koboldcpp 等带图形界面的本地推理前端
  • Text Generation Web UI、Jan AI、LoLLMs、Atomic Chat、ramalama 等社区前端
  • 调用 MTP 推测解码需在 llama.cpp 命令中添加专用参数

采用前要知道的限制

  • 模型卡未提供具体训练数据规模、上下文长度上限与基准跑分成绩
  • 2-bit 系列(IQ2_M、Q2_K)质量较低,仅适合确认能跑通的极限测试
  • BF16 原版需约 54GB 磁盘与 50GB 以上内存,多数家用设备无法加载
  • 量化仓库不提供微调、LoRA 或其他衍生权重