← 返回模型库

unsloth/Muse-Glimmer-30B-GGUF

Muse-Glimmer-30B-GGUF:本地部署的多模态智能体模型

Muse-Glimmer-30B 是 Meta 推出的 30B 参数多模态语言模型,专为本地智能体任务设计,集成多步推理、工具调用、失败恢复和图文理解能力。通过 4-bit 量化可压缩到 24–32GB 显存运行,适合需要在本地搭建自主代理、代码助手或多模态应用的研究者和开发者,使用门槛中等偏高。

本地智能体多模态推理工具调用代码助手
查看模型源页面
下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本条目对应 Unsloth 发布的 GGUF 量化仓库 Muse-Glimmer-30B-GGUF,底座是 Meta Superintelligence Labs 的 Muse-Glimmer-30B 模型(Apache 2.0)。模型能力来源于其 30B 参数 Dense Causal Transformer 加 1.8B 参数 ViT-G/14 感知编码器,支持 131,072 上下文、文本与图像输入、可靠工具调用与失败恢复。GGUF 仓库负责分发 IQ2 到 Q8 多档量化版本以及 DFlash 推测解码伴侣模型。运行层可选 Ollama、llama.cpp 或 LM Studio 等 GGUF 兼容工具。

更适合谁

  • 想要在本地部署 AI 智能体的开发者
  • 需要多模态输入与工具调用能力的研究员
  • 拥有 24–32GB 显存的消费级硬件用户

典型使用场景

  • 本地自主智能体与多步任务执行
  • 代码编写、调试与 SWE-Bench 类工程流
  • 截图、图表、文档的图文理解与推理
  • 多轮工具与函数调用工作流

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

端到端智能体任务完成

模型卡显示面向 DeepSearch QA、MCP-Atlas、τ3-Bench、SWE-Bench 等端到端任务训练

可靠工具调用与失败恢复

支持精确 schema 的函数调用,并在出错时诊断重试

多模态输入与推理

通过 1.8B 参数 ViT 编码器理解截图、图表和文档

长上下文多步推理

131,072 上下文窗口,可跨长链路维持连贯规划

本地部署友好

4-bit 量化可压缩到 24–32GB 显存运行,并提供 DFlash 推测解码

硬件怎么准备

  • Q2/IQ2 量化(文件约 7.5GB):最低 9GB 内存或 8GB 显存,建议 10.5GB 内存或 9.5GB 显存
  • Q3/IQ3 量化(文件约 11.25GB):最低 13.5GB 内存或 11.5GB 显存,建议 16GB 内存或 13.5GB 显存
  • Q4 量化(文件约 15GB):最低 17.5GB 内存或 15.5GB 显存,建议 21GB 内存或 18GB 显存
  • Q5/BF16(文件约 18.75GB):最低 22GB 内存或 19GB 显存,建议 26.5GB 内存或 22GB 显存

量化版本怎么选

  • 模型卡推荐 4-bit K-Quant 变体以适配 24–32GB 显存,模型卡称其相对全精度质量下降极小
  • IQ2/Q2 仅在硬件极度受限且可接受质量下降时考虑
  • Q5 或 BF16 更适合需要接近全精度表现的微调与研究场景
  • Q6/Q8 主要面向 64GB 显存以上的高端工作站或完整精度需求

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q27.0 GB8 GB9.5 GB10.5 GB文件 ↗
IQ27.0 GB8 GB9.5 GB10.5 GB文件 ↗
IQ310 GB11.5 GB13.5 GB16 GB文件 ↗
Q310 GB11.5 GB13.5 GB16 GB文件 ↗
Q414 GB15.5 GB18 GB21 GB文件 ↗
BF1617 GB19 GB22 GB26.5 GB文件 ↗
Q517 GB19 GB22 GB26.5 GB文件 ↗
GGUF17 GB19 GB22 GB26.5 GB文件 ↗
Q621 GB23 GB26.5 GB31.5 GB文件 ↗
Q828 GB30.5 GB35 GB42 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 8GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 9.5GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • Ollama 支持 GGUF 一键加载运行
  • llama.cpp 可用于命令行或本地服务器模式
  • LM Studio 提供图形界面加载 GGUF
  • 配合 DFlash drafter 可启用推测解码以加速生成

采用前要知道的限制

  • 多步推理在训练数据未充分覆盖的新场景中仍可能出错
  • 视频输入按帧处理,未针对视频单独优化
  • 量化版本在边缘案例中可能与全精度存在微小质量差异
  • 未对预训练全部语言做评估,非主推语言性能可能下降