下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
Muse Glimmer 是 Meta Superintelligence Lab 发布的 30B 稠密因果 Transformer 模型,附带约 1.8B 参数的视觉感知编码器,专为本地运行的自动代理任务设计。能力涵盖多步推理、可靠工具调用、失败恢复与多模态输入。本仓库是该模型的 GGUF 量化发布,仅含两份文本量化主模型、感知编码器与 DFlash 推测解码草案器,不发布 bf16 文件。运行依赖 llama.cpp b10353 及以上版本,并兼容 Ollama、LM Studio 等本地推理前端。模型卡未说明非 llama.cpp 系后端的兼容性。
更适合谁
- 本地离线部署自动代理的开发者与研究者
- 需要图文混合输入与工具调用的 AI 工程团队
- 具备 24GB 以上显存或大内存消费级硬件的用户
典型使用场景
- 自动代理任务规划与多步执行
- 截图、图表、文档等图文混合理解
- 代码生成、调试与软件工程类任务
- 离线本地对话、问答与工具增强工作流
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
端到端代理任务执行
支持多轮工作流、代码编写调试与复杂任务规划
可靠工具调用与失败恢复
工具出错时自动诊断并重试
多模态理解
通过独立感知编码器处理文本与图像
长链路多步推理
跨长上下文保持一致规划能力
可控推理强度
支持 low / medium / high / xhigh 多档推理深度
硬件怎么准备
- 文本 Q4_K_M 版最低约 17.5GB 内存或 15.5GB 显存,推荐 21GB 内存或 18GB 显存
- 加载视觉编码器需在文本基础上再加约 1.4GB,加 DFlash 草案器再增约 1.6GB
- 完整多模态运行建议 24GB 显存起步,KQuant-Dynamic 高精度版需 32GB 显存
- CPU 推理可关闭 CUDA 构建;Apple Metal 默认启用,可在该平台本地运行
量化版本怎么选
- KQuant-17GB-Q4_K_M:体积较小,24GB 显存可同时容纳文本、视觉与草案器
- KQuant-Dynamic-Q4_K_XL:精度更高、文件更大,需 32GB 显存
- 仓库未发布 bf16 文件,需要全精度权重请使用基础仓库
- 视觉编码器与草案器均为 Q4_K_M 量化,需与文本主模型配套加载
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q4 | 14 GB | 15.5 GB | 18 GB | 21 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 15.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 18GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp b10353 及以上版本,支持 llama-server、llama-cli、llama-mtmd-cli
- Ollama、LM Studio 等本地推理前端
- 多模态需使用 llama-mtmd-cli 并加载 mmproj 感知编码器
- 可叠加 DFlash 草案器做推测解码,以额外约 1.6GB 内存换取更快生成
采用前要知道的限制
- 必须使用 llama.cpp b10353 或更新版本,旧版本无法识别该架构
- 推理通道无法关闭,只能通过 reasoning_strength 调节深度
- llama-server 中 -c 会被 -np 平分到各槽位,单请求上下文受 n_ctx_slot 限制
- 模型自身不含安全护栏,部署需自行增加额外的输入输出过滤