下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自Blackfrost对Meta Muse-Glimmer-30B的去拒绝权重修改,保留多模态与智能体特性;模型卡未说明具体训练细节与原始能力基准,仅公开450题拒绝行为测试结果。GGUF量化仓库提供Q2_K至Q8_0完整阶梯与F16全精度,并附带独立的视觉投影器与DFlash投机解码草案文件。运行依赖llama.cpp b10353及以上版本,DFlash仅在llama-server下生效,Ollama与LM Studio兼容基础文本量化。
更适合谁
- 想要无拒绝本地推理的研究与开发者
- 拥有24GB以上显存的高端显卡用户
- 需要长上下文与图像输入结合的场景
- 能接受实验性模型缺陷的尝鲜用户
典型使用场景
- 本地智能体任务与代码生成
- 图像理解与多模态对话
- 超长文档分析与处理
- 需要无审查输出的研究场景
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
去拒绝权重处理
Blackfrost权重修改完全移除拒绝行为,450题基准真实拒绝率0%
多模态输入
配套视觉投影器,支持图像到文本任务
超长上下文
原生131072 token上下文窗口
DFlash投机解码
在llama-server下提供约1.6倍解码加速
完整量化阶梯
Q2_K到Q8_0加F16,覆盖消费级与工作站硬件
硬件怎么准备
- Q4_K_M约15.8GB,建议显存约18GB适配24GB显卡
- Q2_K约10GB,建议显存约9.5GB为最小可行方案
- Q6_K与Q8_0高保真版本需23GB以上显存
- CPU推理需匹配推荐内存16至42GB,模型卡未说明速度
量化版本怎么选
- Q4_K_M为默认推荐平衡档,适合24GB显卡与多数本地场景
- 显存紧张可选Q2_K或Q3_K_S缩小体积
- 追求高保真输出可选Q8_0或F16
- 视觉投影器与DFlash草案另有Q4_K_M与F16独立选项
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 8GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 9.5GB。
阅读 12GB 显存选型指南 →可以怎样运行
- llama.cpp b10353以上的llama-server启用DFlash投机解码
- Ollama与LM Studio加载基础文本量化版本
- 仓库自带一键部署脚本自动拉取并启动服务
- 启用flash attention提升峰值吞吐
采用前要知道的限制
- 模型卡标注为实验性版本,解码与一致性可能存在缺陷
- DFlash仅在llama-server下可用,不支持llama-cli
- 必须启用Jinja模板,否则可能产生重复推理指令冲突
- max_tokens低于1024时推理通道易耗尽额度返回空内容