← 返回模型库

Blackfrost-AI/Muse-Glimmer-30B-Abliterated-GGUF

Muse-Glimmer-30B-Abliterated-GGUF:本地多模态去拒绝30B模型

基于Meta的30B多模态智能体模型的去拒绝权重修改版,GGUF格式打包,可在单卡消费级GPU或CPU上完全离线运行。支持131K长上下文、图像输入与DFlash投机解码加速,适合本地部署研究与智能体任务,但属实验性版本,需较高端硬件与新版llama.cpp。

多模态去拒绝本地部署
查看模型源页面
下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自Blackfrost对Meta Muse-Glimmer-30B的去拒绝权重修改,保留多模态与智能体特性;模型卡未说明具体训练细节与原始能力基准,仅公开450题拒绝行为测试结果。GGUF量化仓库提供Q2_K至Q8_0完整阶梯与F16全精度,并附带独立的视觉投影器与DFlash投机解码草案文件。运行依赖llama.cpp b10353及以上版本,DFlash仅在llama-server下生效,Ollama与LM Studio兼容基础文本量化。

更适合谁

  • 想要无拒绝本地推理的研究与开发者
  • 拥有24GB以上显存的高端显卡用户
  • 需要长上下文与图像输入结合的场景
  • 能接受实验性模型缺陷的尝鲜用户

典型使用场景

  • 本地智能体任务与代码生成
  • 图像理解与多模态对话
  • 超长文档分析与处理
  • 需要无审查输出的研究场景

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

去拒绝权重处理

Blackfrost权重修改完全移除拒绝行为,450题基准真实拒绝率0%

多模态输入

配套视觉投影器,支持图像到文本任务

超长上下文

原生131072 token上下文窗口

DFlash投机解码

在llama-server下提供约1.6倍解码加速

完整量化阶梯

Q2_K到Q8_0加F16,覆盖消费级与工作站硬件

硬件怎么准备

  • Q4_K_M约15.8GB,建议显存约18GB适配24GB显卡
  • Q2_K约10GB,建议显存约9.5GB为最小可行方案
  • Q6_K与Q8_0高保真版本需23GB以上显存
  • CPU推理需匹配推荐内存16至42GB,模型卡未说明速度

量化版本怎么选

  • Q4_K_M为默认推荐平衡档,适合24GB显卡与多数本地场景
  • 显存紧张可选Q2_K或Q3_K_S缩小体积
  • 追求高保真输出可选Q8_0或F16
  • 视觉投影器与DFlash草案另有Q4_K_M与F16独立选项

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q27.0 GB8 GB9.5 GB10.5 GB文件 ↗
Q310 GB11.5 GB13.5 GB16 GB文件 ↗
Q414 GB15.5 GB18 GB21 GB文件 ↗
Q517 GB19 GB22 GB26.5 GB文件 ↗
F1617 GB19 GB22 GB26.5 GB文件 ↗
Q621 GB23 GB26.5 GB31.5 GB文件 ↗
Q828 GB30.5 GB35 GB42 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 8GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 9.5GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • llama.cpp b10353以上的llama-server启用DFlash投机解码
  • Ollama与LM Studio加载基础文本量化版本
  • 仓库自带一键部署脚本自动拉取并启动服务
  • 启用flash attention提升峰值吞吐

采用前要知道的限制

  • 模型卡标注为实验性版本,解码与一致性可能存在缺陷
  • DFlash仅在llama-server下可用,不支持llama-cli
  • 必须启用Jinja模板,否则可能产生重复推理指令冲突
  • max_tokens低于1024时推理通道易耗尽额度返回空内容