下载量
0
参数
1B
上下文
未说明
架构 / 任务
未分类
许可证
other
MODEL POSITIONING
这个模型解决什么问题?
本仓库是合并后 MiniCPM5-1B 代理工具调用模型的 GGUF 量化仓库;同作者的 Merged-FP16 与 QLoRA 适配器分属其他仓库,提供原始训练形态。模型能力来源于 openbmb 基础 MiniCPM5-1B 在 ToolACE 衍生基准上的微调结果,仓库本身不进行独立训练,仅做 GGUF 转换。运行工具方面,OpenBMB 推荐 SGLang 加 minicpm5 解析器作为官方工具调用方案;llama.cpp、Ollama、LM Studio 提供通用 GGUF 加载;vLLM 对 GGUF 支持到 2026 年 7 月仍属高度实验性,高吞吐场景更建议用合并 safetensors 仓库。模型输出标准 XML 函数块,需配合外部解析、校验、执行循环使用。
更适合谁
- 需要在本地或边缘设备运行 AI 代理的开发者
- 搭建轻量函数调用机器人或自动化工作流的技术用户
- 研究 Agent 工具选择行为的评测者
- 对小模型工具调用一致性感兴趣的爱好者
典型使用场景
- 本地 AI 代理读取工具定义后自动调用 API 或脚本
- 边缘设备上的轻量 Agent 原型与演示
- 函数调用一致性、工具选择行为的研究与基准复现
- 低资源环境下搭建任务自动化机器人
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
极小体积
1B 参数 + Q4_K_M 仅约 688 MB,低端设备可跑
工具调用解析率高
ToolACE 风格评测中 99.33% 生成可解析的 XML 调用块
工具选择准确
92.67% 命中预期工具名,97% 输出当前可用工具名
标准 XML 函数块格式
原生输出方便与外部运行时对接
量化梯度丰富
F16、Q8_0、Q4_K_M 三档可选,平衡保真度与体积
硬件怎么准备
- 入门 4GB 内存加 1GB 显存可加载 Q4_K_M
- 推荐 8GB 内存加 2GB 显存以留出余量
- Q8_0 最低显存约 1.5GB,建议显存 2.5GB 较稳
- F16 文件约 2.17 GB,显存充足的基准场景更合适
量化版本怎么选
- 日常本地使用首选 Q4_K_M,体积与质量平衡
- 需要更高还原度可选 Q8_0,约 1.15 GB
- F16 仅作参考转换与最佳保真度,不建议常规部署
- 量化文件尚未独立完成 300 例 ToolACE 评测,结果可能与 FP16 源不同
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。
阅读 4GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载,最成熟的 GGUF 支持路径
- Ollama 与 LM Studio 提供一键启动体验
- OpenBMB 官方推荐 SGLang 配合 minicpm5 解析器
- vLLM 加载 GGUF 仍属实验性,合并 safetensors 仓库更稳定
采用前要知道的限制
- 模型卡未给出各量化档的速度与质量独立对比
- 自然停止率仅 15%,需借助解析器在首个完成函数块处强制停止
- 仅有 300 例 ToolACE 衍生评测,未覆盖多轮与未见工具
- vLLM 对 GGUF 支持到 2026 年 7 月仍标记高度实验性