下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本条目对应 Unsloth 发布的 GGUF 量化仓库 Muse-Glimmer-30B-GGUF,底座是 Meta Superintelligence Labs 的 Muse-Glimmer-30B 模型(Apache 2.0)。模型能力来源于其 30B 参数 Dense Causal Transformer 加 1.8B 参数 ViT-G/14 感知编码器,支持 131,072 上下文、文本与图像输入、可靠工具调用与失败恢复。GGUF 仓库负责分发 IQ2 到 Q8 多档量化版本以及 DFlash 推测解码伴侣模型。运行层可选 Ollama、llama.cpp 或 LM Studio 等 GGUF 兼容工具。
更适合谁
- 想要在本地部署 AI 智能体的开发者
- 需要多模态输入与工具调用能力的研究员
- 拥有 24–32GB 显存的消费级硬件用户
典型使用场景
- 本地自主智能体与多步任务执行
- 代码编写、调试与 SWE-Bench 类工程流
- 截图、图表、文档的图文理解与推理
- 多轮工具与函数调用工作流
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
端到端智能体任务完成
模型卡显示面向 DeepSearch QA、MCP-Atlas、τ3-Bench、SWE-Bench 等端到端任务训练
可靠工具调用与失败恢复
支持精确 schema 的函数调用,并在出错时诊断重试
多模态输入与推理
通过 1.8B 参数 ViT 编码器理解截图、图表和文档
长上下文多步推理
131,072 上下文窗口,可跨长链路维持连贯规划
本地部署友好
4-bit 量化可压缩到 24–32GB 显存运行,并提供 DFlash 推测解码
硬件怎么准备
- Q2/IQ2 量化(文件约 7.5GB):最低 9GB 内存或 8GB 显存,建议 10.5GB 内存或 9.5GB 显存
- Q3/IQ3 量化(文件约 11.25GB):最低 13.5GB 内存或 11.5GB 显存,建议 16GB 内存或 13.5GB 显存
- Q4 量化(文件约 15GB):最低 17.5GB 内存或 15.5GB 显存,建议 21GB 内存或 18GB 显存
- Q5/BF16(文件约 18.75GB):最低 22GB 内存或 19GB 显存,建议 26.5GB 内存或 22GB 显存
量化版本怎么选
- 模型卡推荐 4-bit K-Quant 变体以适配 24–32GB 显存,模型卡称其相对全精度质量下降极小
- IQ2/Q2 仅在硬件极度受限且可接受质量下降时考虑
- Q5 或 BF16 更适合需要接近全精度表现的微调与研究场景
- Q6/Q8 主要面向 64GB 显存以上的高端工作站或完整精度需求
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q2 | 7.0 GB | 8 GB | 9.5 GB | 10.5 GB | 文件 ↗ |
| IQ2 | 7.0 GB | 8 GB | 9.5 GB | 10.5 GB | 文件 ↗ |
| IQ3 | 10 GB | 11.5 GB | 13.5 GB | 16 GB | 文件 ↗ |
| Q3 | 10 GB | 11.5 GB | 13.5 GB | 16 GB | 文件 ↗ |
| Q4 | 14 GB | 15.5 GB | 18 GB | 21 GB | 文件 ↗ |
| BF16 | 17 GB | 19 GB | 22 GB | 26.5 GB | 文件 ↗ |
| Q5 | 17 GB | 19 GB | 22 GB | 26.5 GB | 文件 ↗ |
| GGUF | 17 GB | 19 GB | 22 GB | 26.5 GB | 文件 ↗ |
| Q6 | 21 GB | 23 GB | 26.5 GB | 31.5 GB | 文件 ↗ |
| Q8 | 28 GB | 30.5 GB | 35 GB | 42 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 8GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 9.5GB。
阅读 12GB 显存选型指南 →可以怎样运行
- Ollama 支持 GGUF 一键加载运行
- llama.cpp 可用于命令行或本地服务器模式
- LM Studio 提供图形界面加载 GGUF
- 配合 DFlash drafter 可启用推测解码以加速生成
采用前要知道的限制
- 多步推理在训练数据未充分覆盖的新场景中仍可能出错
- 视频输入按帧处理,未针对视频单独优化
- 量化版本在边缘案例中可能与全精度存在微小质量差异
- 未对预训练全部语言做评估,非主推语言性能可能下降