← 返回模型库

AtomicChat/Qwen3.8-27B-GGUF

Qwen3.8-27B-GGUF:支持图像理解的多模态对话量化版

基于Qwen3.8-27B的多模态对话模型量化版本,支持图像理解与文本生成,原生提供思维链开关。提供从IQ1到Q8_0十余种量化文件与独立视觉投影组件,最低约3.5GB显存可启动小量化,但完整能力需中高端显存。适合具备中高显卡配置、想在本地运行视觉对话与推理任务的用户。

多模态对话视觉理解长上下文本地部署
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
未声明

MODEL POSITIONING

这个模型解决什么问题?

模型层面,Qwen3.8-27B是原生支持图像与文本输入的多模态对话模型,架构为带门控与状态路径的混合注意力,并集成多token预测头,原生支持思维链开关,模型卡未说明具体许可。仓库层面,本仓库由AtomicChat发布基于自研重要性矩阵的GGUF量化文件,覆盖IQ1到Q8_0共十余种精度,附带独立视觉投影文件mmproj可与各量化主文件配合。运行层面,支持llama.cpp、Ollama与LM Studio,需较新版本llama.cpp以获得qwen35架构支持。

更适合谁

  • 希望本地部署27B级多模态对话模型的研究者与开发者
  • 想尝试Qwen3.8思维链开关功能的用户
  • 具备12GB以上显存显卡的本地推理玩家
  • 关注量化精度与原模型差距的技术评测用户

典型使用场景

  • 本地视觉问答与图像内容理解
  • 长文档摘要、代码生成与多轮对话
  • 思维链推理与复杂任务拆解
  • 离线环境下的多模态助手应用

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多模态输入

支持图像与文本联合输入,可读取图片内容并完成视觉问答

长上下文

原生支持262144上下文,无需额外配置

思维链开关

集成thinking模式,可在生成中切换推理深度

量化精度梯度完整

从IQ1_M到Q8_0提供完整阶梯,KL散度与top-1均有实测数据

自研重要性矩阵

基于针对Qwen3.8构建的语料训练,覆盖对话、代码、推理、多语种等场景

硬件怎么准备

  • 12GB显存显卡:可使用AD-IQ2_S等小量化,约10GB大小,仅支持短上下文或部分层CPU卸载
  • 16GB显存显卡:建议AD-IQ3_S,约14GB大小,约可跑8k上下文
  • 24GB显存显卡:建议AD-Q5_K_M-Q4_K_M,约18GB大小,约可跑16k上下文
  • 48GB及以上显存:可上Q8_0,约28GB,接近原模型精度并支持更长上下文

量化版本怎么选

  • 12GB显存选AD-IQ2_S;16GB选AD-IQ3_S;24GB选AD-Q5_K_M-Q4_K_M;32GB选AD-Q6_K;48GB以上可上Q8_0
  • IQ1_M极小量化(约8.5GB)虽能跑但KL散度达0.34,精度损失大,仅适合尝鲜
  • 量化阶梯相邻文件相差1到2GB,14GB以下曲线变陡,优先选邻近较大文件
  • 视觉投影文件mmproj独立下载,F16与BF16版本按运行环境偏好二选一

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ13.1 GB3.5 GB4.5 GB8 GB文件 ↗
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp直接加载主量化与mmproj文件,需支持qwen35架构的较新版本
  • Ollama直接拉取运行,已确认兼容
  • LM Studio加载GGUF文件并启动对话
  • 建议设置--image-min-tokens 1024保证视觉位置编码可靠

采用前要知道的限制

  • 模型卡未说明原始Qwen3.8-27B许可类型,商业使用前需自行核查上游许可证
  • 视觉识别要求至少1024图像token,否则位置信息可能不稳定
  • 多token预测头被固定为q5_k精度,理论上不完全无损
  • 部分极小量化(IQ1_M、IQ2_XS等)KL散度较高,生成质量明显下降