← 返回模型库

meta-models/Muse-Glimmer-30B-GGUF

Muse-Glimmer-30B-GGUF:本地多模态代理大模型

Muse-Glimmer-30B 是 Meta 发布的 30B 参数本地代理大模型,集成多步推理、工具调用、失败恢复与图像理解,主打端到端自动代理任务。适合需要在本地离线部署 AI 代理、编写调试代码或处理图文混合输入的开发者与研究者。

本地代理多模态大模型工具调用代码与代理任务
查看模型源页面
下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

Muse Glimmer 是 Meta Superintelligence Lab 发布的 30B 稠密因果 Transformer 模型,附带约 1.8B 参数的视觉感知编码器,专为本地运行的自动代理任务设计。能力涵盖多步推理、可靠工具调用、失败恢复与多模态输入。本仓库是该模型的 GGUF 量化发布,仅含两份文本量化主模型、感知编码器与 DFlash 推测解码草案器,不发布 bf16 文件。运行依赖 llama.cpp b10353 及以上版本,并兼容 Ollama、LM Studio 等本地推理前端。模型卡未说明非 llama.cpp 系后端的兼容性。

更适合谁

  • 本地离线部署自动代理的开发者与研究者
  • 需要图文混合输入与工具调用的 AI 工程团队
  • 具备 24GB 以上显存或大内存消费级硬件的用户

典型使用场景

  • 自动代理任务规划与多步执行
  • 截图、图表、文档等图文混合理解
  • 代码生成、调试与软件工程类任务
  • 离线本地对话、问答与工具增强工作流

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

端到端代理任务执行

支持多轮工作流、代码编写调试与复杂任务规划

可靠工具调用与失败恢复

工具出错时自动诊断并重试

多模态理解

通过独立感知编码器处理文本与图像

长链路多步推理

跨长上下文保持一致规划能力

可控推理强度

支持 low / medium / high / xhigh 多档推理深度

硬件怎么准备

  • 文本 Q4_K_M 版最低约 17.5GB 内存或 15.5GB 显存,推荐 21GB 内存或 18GB 显存
  • 加载视觉编码器需在文本基础上再加约 1.4GB,加 DFlash 草案器再增约 1.6GB
  • 完整多模态运行建议 24GB 显存起步,KQuant-Dynamic 高精度版需 32GB 显存
  • CPU 推理可关闭 CUDA 构建;Apple Metal 默认启用,可在该平台本地运行

量化版本怎么选

  • KQuant-17GB-Q4_K_M:体积较小,24GB 显存可同时容纳文本、视觉与草案器
  • KQuant-Dynamic-Q4_K_XL:精度更高、文件更大,需 32GB 显存
  • 仓库未发布 bf16 文件,需要全精度权重请使用基础仓库
  • 视觉编码器与草案器均为 Q4_K_M 量化,需与文本主模型配套加载

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q414 GB15.5 GB18 GB21 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 15.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 18GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp b10353 及以上版本,支持 llama-server、llama-cli、llama-mtmd-cli
  • Ollama、LM Studio 等本地推理前端
  • 多模态需使用 llama-mtmd-cli 并加载 mmproj 感知编码器
  • 可叠加 DFlash 草案器做推测解码,以额外约 1.6GB 内存换取更快生成

采用前要知道的限制

  • 必须使用 llama.cpp b10353 或更新版本,旧版本无法识别该架构
  • 推理通道无法关闭,只能通过 reasoning_strength 调节深度
  • llama-server 中 -c 会被 -np 平分到各槽位,单请求上下文受 n_ctx_slot 限制
  • 模型自身不含安全护栏,部署需自行增加额外的输入输出过滤