← 返回模型库

ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

Qwen3.8-27B-GSQ-RCO-GGUF:27B 视觉语言模型非均匀量化

Qwen3.8-27B(27B 参数视觉语言模型)的非均匀 GGUF 量化版,使用 GSQ 与 RCO 混合精度方法逐张量分配精度,提供 IQ2 到 IQ3 多档并附带视觉投影器支持图文多模态。适合想在消费级硬件跑 27B 多模态模型的用户,最低约 8GB 内存或 7GB 显存可加载 IQ2 档,IQ3 档推荐 14.

27B 多模态非均匀量化视觉语言模型本地部署
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,原始权重来自 Qwen/Qwen3.8-27B 基模型,仓库标记的 pipeline_tag 为 image-text-to-text 并附带 BF16 视觉投影器,说明支持图文多模态,模型卡未提供具体上下文长度、训练数据与基准成绩等说明。量化仓库方面,本仓库由 ISTA-DASLab 维护,采用 GSQ 逐张量低比特标量量化与 RCO 黎曼约束优化进行非均匀精度分配,并提供 IQ2 至 IQ3 四档(IQ2_XS、IQ2_S、IQ3_XXS、IQ3_S)与 imatrix 重要性矩阵供复现验证。运行工具方面,量化文件可直接用于 llama.cpp、Ollama 与 LM Studio,模型卡未说明官方推荐推理参数或硬件速度预期。

更适合谁

  • 拥有 8GB 至 24GB 内存或显存、希望在本地跑 27B 多模态模型的部署用户
  • 关注低比特量化质量、希望在小体积下保持接近原模型表现的研究者
  • 偏好 Ollama、LM Studio 或 llama.cpp 等本地工具链的开源模型使用者

典型使用场景

  • 消费级显卡或内存有限的本地 27B 视觉语言模型推理
  • 低比特量化方法、逐张量精度分配与重要性矩阵相关研究
  • Ollama 或 LM Studio 桌面环境下的多模态对话与图像理解
  • 对存储体积敏感、需在 BF16 与极低比特之间权衡的部署场景

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

非均匀混合精度量化

采用 GSQ 与 RCO 对每个张量按敏感度分配精度,在低比特下尽量保持质量

多档位覆盖与 task-lossless 档位

提供 IQ2_XS、IQ2_S、IQ3_XXS、IQ3_S 四档,IQ3_S 在多项推理任务上接近 BF16 基线

多模态视觉支持

自带 BF16 视觉投影器 mmproj,可与任一量化权重组合做图文理解

推测解码可选

提供 -mtp 版本(约大 0.35GB)支持 llama.cpp 的 Multi-Token Prediction 推测解码

复现与审计友好

附带 imatrix 重要性矩阵与每张量分配表,便于验证与重建

硬件怎么准备

  • IQ2_S-mtp 推理档文件约 6.75GB:最低 8GB 内存或 7GB 显存,建议 9.5GB 内存或 8GB 显存
  • IQ3_S-mtp 推理档文件约 10.13GB:最低 12GB 内存或 10.5GB 显存,建议 14.5GB 内存或 12GB 显存
  • imatrix-qwen3.8-27b.gguf 与 mmproj-Qwen3.8-27B-BF16.gguf 文件按列表标注约 16.88GB:最低 20GB 内存或 17GB 显存,建议 24GB 内存或 19.5GB 显存
  • 以上为内存与显存占用估算,模型卡未说明实际推理速度、首 token 延迟或长上下文吞吐

量化版本怎么选

  • IQ3_S(约 3.50 bpw、11.8GB)被仓库标为 task-lossless 档,体积约为 BF16 基线的五分之一
  • IQ2_S(约 2.75 bpw、9.3GB)在 AIME25 上与基线持平,是体积与质量较平衡的折中
  • 使用 llama.cpp 推测解码时可改选 -mtp 版本,文件约多 0.35GB,权重其余部分一致
  • 启用多模态需额外加载 mmproj 视觉投影器,与所选量化权重分别加载

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载 GSQ-RCO 系列 GGUF 文件进行推理
  • Ollama 与 LM Studio 可按仓库名搜索并选用 GSQ-RCO 构建
  • 图文多模态场景需额外加载 mmproj 视觉投影器文件

采用前要知道的限制

  • 模型卡未提供上下文长度、训练数据规模与详细能力基准的说明
  • IQ2 及更低档位在 GPQA-Diamond、LiveCodeBench 等任务上与 BF16 仍有可测差距
  • 量化权重许可继承自 Qwen3.8-27B 原协议,使用与分发须自行核实
  • 视觉编码器与多模态细节由基模型决定,本仓库未做额外说明