← 返回模型库

ewinregirgojr/MiniCPM5-1B-Agentic-Tooluse-GGUF

MiniCPM5-1B-Agentic-Tooluse-GGUF:轻量代理工具调用小模型

这是基于 openbmb MiniCPM5-1B、经 Nemotron SFT+DPO 修复微调后的 1B 参数代理工具调用模型,提供 F16、Q8_0、Q4_K_M 三档 GGUF 量化。适合想在本地或边缘设备上做 AI 代理、需要模型按 XML 函数块格式稳定选择并调用工具的开发者与研究者。

工具调用代理轻量小模型本地运行GGUF 量化
查看模型源页面
下载量
0
参数
1B
上下文
未说明
架构 / 任务
未分类
许可证
other

MODEL POSITIONING

这个模型解决什么问题?

本仓库是合并后 MiniCPM5-1B 代理工具调用模型的 GGUF 量化仓库;同作者的 Merged-FP16 与 QLoRA 适配器分属其他仓库,提供原始训练形态。模型能力来源于 openbmb 基础 MiniCPM5-1B 在 ToolACE 衍生基准上的微调结果,仓库本身不进行独立训练,仅做 GGUF 转换。运行工具方面,OpenBMB 推荐 SGLang 加 minicpm5 解析器作为官方工具调用方案;llama.cpp、Ollama、LM Studio 提供通用 GGUF 加载;vLLM 对 GGUF 支持到 2026 年 7 月仍属高度实验性,高吞吐场景更建议用合并 safetensors 仓库。模型输出标准 XML 函数块,需配合外部解析、校验、执行循环使用。

更适合谁

  • 需要在本地或边缘设备运行 AI 代理的开发者
  • 搭建轻量函数调用机器人或自动化工作流的技术用户
  • 研究 Agent 工具选择行为的评测者
  • 对小模型工具调用一致性感兴趣的爱好者

典型使用场景

  • 本地 AI 代理读取工具定义后自动调用 API 或脚本
  • 边缘设备上的轻量 Agent 原型与演示
  • 函数调用一致性、工具选择行为的研究与基准复现
  • 低资源环境下搭建任务自动化机器人

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

极小体积

1B 参数 + Q4_K_M 仅约 688 MB,低端设备可跑

工具调用解析率高

ToolACE 风格评测中 99.33% 生成可解析的 XML 调用块

工具选择准确

92.67% 命中预期工具名,97% 输出当前可用工具名

标准 XML 函数块格式

原生输出方便与外部运行时对接

量化梯度丰富

F16、Q8_0、Q4_K_M 三档可选,平衡保真度与体积

硬件怎么准备

  • 入门 4GB 内存加 1GB 显存可加载 Q4_K_M
  • 推荐 8GB 内存加 2GB 显存以留出余量
  • Q8_0 最低显存约 1.5GB,建议显存 2.5GB 较稳
  • F16 文件约 2.17 GB,显存充足的基准场景更合适

量化版本怎么选

  • 日常本地使用首选 Q4_K_M,体积与质量平衡
  • 需要更高还原度可选 Q8_0,约 1.15 GB
  • F16 仅作参考转换与最佳保真度,不建议常规部署
  • 量化文件尚未独立完成 300 例 ToolACE 评测,结果可能与 FP16 源不同

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q40.5 GB1 GB2 GB8 GB文件 ↗
F160.6 GB1 GB2 GB8 GB文件 ↗
Q80.9 GB1.5 GB2.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载,最成熟的 GGUF 支持路径
  • Ollama 与 LM Studio 提供一键启动体验
  • OpenBMB 官方推荐 SGLang 配合 minicpm5 解析器
  • vLLM 加载 GGUF 仍属实验性,合并 safetensors 仓库更稳定

采用前要知道的限制

  • 模型卡未给出各量化档的速度与质量独立对比
  • 自然停止率仅 15%,需借助解析器在首个完成函数块处强制停止
  • 仅有 300 例 ToolACE 衍生评测,未覆盖多轮与未见工具
  • vLLM 对 GGUF 支持到 2026 年 7 月仍标记高度实验性