下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
未声明
MODEL POSITIONING
这个模型解决什么问题?
模型层面,Qwen3.8-27B是原生支持图像与文本输入的多模态对话模型,架构为带门控与状态路径的混合注意力,并集成多token预测头,原生支持思维链开关,模型卡未说明具体许可。仓库层面,本仓库由AtomicChat发布基于自研重要性矩阵的GGUF量化文件,覆盖IQ1到Q8_0共十余种精度,附带独立视觉投影文件mmproj可与各量化主文件配合。运行层面,支持llama.cpp、Ollama与LM Studio,需较新版本llama.cpp以获得qwen35架构支持。
更适合谁
- 希望本地部署27B级多模态对话模型的研究者与开发者
- 想尝试Qwen3.8思维链开关功能的用户
- 具备12GB以上显存显卡的本地推理玩家
- 关注量化精度与原模型差距的技术评测用户
典型使用场景
- 本地视觉问答与图像内容理解
- 长文档摘要、代码生成与多轮对话
- 思维链推理与复杂任务拆解
- 离线环境下的多模态助手应用
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态输入
支持图像与文本联合输入,可读取图片内容并完成视觉问答
长上下文
原生支持262144上下文,无需额外配置
思维链开关
集成thinking模式,可在生成中切换推理深度
量化精度梯度完整
从IQ1_M到Q8_0提供完整阶梯,KL散度与top-1均有实测数据
自研重要性矩阵
基于针对Qwen3.8构建的语料训练,覆盖对话、代码、推理、多语种等场景
硬件怎么准备
- 12GB显存显卡:可使用AD-IQ2_S等小量化,约10GB大小,仅支持短上下文或部分层CPU卸载
- 16GB显存显卡:建议AD-IQ3_S,约14GB大小,约可跑8k上下文
- 24GB显存显卡:建议AD-Q5_K_M-Q4_K_M,约18GB大小,约可跑16k上下文
- 48GB及以上显存:可上Q8_0,约28GB,接近原模型精度并支持更长上下文
量化版本怎么选
- 12GB显存选AD-IQ2_S;16GB选AD-IQ3_S;24GB选AD-Q5_K_M-Q4_K_M;32GB选AD-Q6_K;48GB以上可上Q8_0
- IQ1_M极小量化(约8.5GB)虽能跑但KL散度达0.34,精度损失大,仅适合尝鲜
- 量化阶梯相邻文件相差1到2GB,14GB以下曲线变陡,优先选邻近较大文件
- 视觉投影文件mmproj独立下载,F16与BF16版本按运行环境偏好二选一
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ1 | 3.1 GB | 3.5 GB | 4.5 GB | 8 GB | 文件 ↗ |
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp直接加载主量化与mmproj文件,需支持qwen35架构的较新版本
- Ollama直接拉取运行,已确认兼容
- LM Studio加载GGUF文件并启动对话
- 建议设置--image-min-tokens 1024保证视觉位置编码可靠
采用前要知道的限制
- 模型卡未说明原始Qwen3.8-27B许可类型,商业使用前需自行核查上游许可证
- 视觉识别要求至少1024图像token,否则位置信息可能不稳定
- 多token预测头被固定为q5_k精度,理论上不完全无损
- 部分极小量化(IQ1_M、IQ2_XS等)KL散度较高,生成质量明显下降