下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,原始权重来自 Qwen/Qwen3.8-27B 基模型,仓库标记的 pipeline_tag 为 image-text-to-text 并附带 BF16 视觉投影器,说明支持图文多模态,模型卡未提供具体上下文长度、训练数据与基准成绩等说明。量化仓库方面,本仓库由 ISTA-DASLab 维护,采用 GSQ 逐张量低比特标量量化与 RCO 黎曼约束优化进行非均匀精度分配,并提供 IQ2 至 IQ3 四档(IQ2_XS、IQ2_S、IQ3_XXS、IQ3_S)与 imatrix 重要性矩阵供复现验证。运行工具方面,量化文件可直接用于 llama.cpp、Ollama 与 LM Studio,模型卡未说明官方推荐推理参数或硬件速度预期。
更适合谁
- 拥有 8GB 至 24GB 内存或显存、希望在本地跑 27B 多模态模型的部署用户
- 关注低比特量化质量、希望在小体积下保持接近原模型表现的研究者
- 偏好 Ollama、LM Studio 或 llama.cpp 等本地工具链的开源模型使用者
典型使用场景
- 消费级显卡或内存有限的本地 27B 视觉语言模型推理
- 低比特量化方法、逐张量精度分配与重要性矩阵相关研究
- Ollama 或 LM Studio 桌面环境下的多模态对话与图像理解
- 对存储体积敏感、需在 BF16 与极低比特之间权衡的部署场景
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
非均匀混合精度量化
采用 GSQ 与 RCO 对每个张量按敏感度分配精度,在低比特下尽量保持质量
多档位覆盖与 task-lossless 档位
提供 IQ2_XS、IQ2_S、IQ3_XXS、IQ3_S 四档,IQ3_S 在多项推理任务上接近 BF16 基线
多模态视觉支持
自带 BF16 视觉投影器 mmproj,可与任一量化权重组合做图文理解
推测解码可选
提供 -mtp 版本(约大 0.35GB)支持 llama.cpp 的 Multi-Token Prediction 推测解码
复现与审计友好
附带 imatrix 重要性矩阵与每张量分配表,便于验证与重建
硬件怎么准备
- IQ2_S-mtp 推理档文件约 6.75GB:最低 8GB 内存或 7GB 显存,建议 9.5GB 内存或 8GB 显存
- IQ3_S-mtp 推理档文件约 10.13GB:最低 12GB 内存或 10.5GB 显存,建议 14.5GB 内存或 12GB 显存
- imatrix-qwen3.8-27b.gguf 与 mmproj-Qwen3.8-27B-BF16.gguf 文件按列表标注约 16.88GB:最低 20GB 内存或 17GB 显存,建议 24GB 内存或 19.5GB 显存
- 以上为内存与显存占用估算,模型卡未说明实际推理速度、首 token 延迟或长上下文吞吐
量化版本怎么选
- IQ3_S(约 3.50 bpw、11.8GB)被仓库标为 task-lossless 档,体积约为 BF16 基线的五分之一
- IQ2_S(约 2.75 bpw、9.3GB)在 AIME25 上与基线持平,是体积与质量较平衡的折中
- 使用 llama.cpp 推测解码时可改选 -mtp 版本,文件约多 0.35GB,权重其余部分一致
- 启用多模态需额外加载 mmproj 视觉投影器,与所选量化权重分别加载
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载 GSQ-RCO 系列 GGUF 文件进行推理
- Ollama 与 LM Studio 可按仓库名搜索并选用 GSQ-RCO 构建
- 图文多模态场景需额外加载 mmproj 视觉投影器文件
采用前要知道的限制
- 模型卡未提供上下文长度、训练数据规模与详细能力基准的说明
- IQ2 及更低档位在 GPQA-Diamond、LiveCodeBench 等任务上与 BF16 仍有可测差距
- 量化权重许可继承自 Qwen3.8-27B 原协议,使用与分发须自行核实
- 视觉编码器与多模态细节由基模型决定,本仓库未做额外说明