← 返回模型库

openbmb/MiniCPM5-2B-GGUF

MiniCPM5-2B-GGUF:本地可跑的2B长上下文中文助手

MiniCPM5-2B-GGUF 是面壁智能开源的2B参数稠密 Transformer GGUF 量化仓库,主打本地部署、端侧推理与资源受限场景。原生支持 131K 长上下文,覆盖代码、数学、工具调用与智能体任务。

本地中文助手2B轻量模型长上下文工具调用Agent
查看模型源页面
下载量
0
参数
2B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自同名 2B 稠密 LlamaForCausalLM,定位本地助手、长上下文、工具与 Agent 场景;该 GGUF 仓库仅发布量化文件,不含 BF16、SFT、Midtrain 等中间检查点,这些权重需到 ModelScope 对应仓库获取。仓库同时兼容 llama.cpp、Ollama、LM Studio 三类常见本地工具,但 DSpark 推测解码草案模型与 GPTQ、MLX、LiteRT 等格式不在此仓库内。模型卡未给出具体的解码速度或端到端延迟数据。

更适合谁

  • 想在消费级笔记本或台式机上自托管中文助手的个人开发者与本地 AI 爱好者
  • 需要在边缘设备或低显存机器上跑长文档问答、代码补全与工具调用的用户
  • 对数据隐私有要求、希望离线运行的中小团队与研究者
  • 研究 2B 级稠密模型在 Agent、Tool Use、长上下文场景表现的用户

典型使用场景

  • 中文长文档摘要、跨段落问答与多轮长上下文对话
  • 本地代码补全、代码理解与小型 Agent 工作流
  • 工具调用型聊天助手,例如让模型调用本地脚本或外部 API
  • 边缘设备或资源受限场景下的轻量推理应用与离线问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

原生长上下文

原生 131,072 token 上下文窗口,适合长文档与多轮 Agent 任务

2B 级开源 SOTA

在同尺寸开源对比中平均得分 53.9,超过多数被列出的 4B 级参考模型

代码与数学强项

训练数据包含 UltraData-Code、UltraData-Math,并在 LiveCodeBench、MATH-500、AIME 等榜单相对同尺寸模型有明显优势

工具与 Agent 能力

训练数据包含 UltraData-SFT-Agent-2609 等 500K Agent 样本,主打工具调用与多步代理

端侧友好部署

2.5B 参数、Q4_K_M 仅约 1GB,最低 1.5GB 显存即可加载运行

硬件怎么准备

  • 至少 4GB 内存 + 1.5GB 显存即可加载 Q4_K_M 版本,文件约 1GB
  • 推荐配置 8GB 内存 + 2.5GB 显存,便于运行 Q4_K_M 或 F16 版本(文件约 1.25GB)并保留余量
  • 想跑 Q8_0 版本(文件约 2GB)建议显存 3.5GB 以上
  • 纯 CPU 推理可走 llama.cpp 或 Ollama,模型卡未给出具体速度数据

量化版本怎么选

  • 显存紧张或机器较旧时优先选 Q4_K_M,体积与质量折中较好
  • 想尽量保留原始能力且显存够用时选 F16,避免量化损失
  • Q8_0 在 Q4 与 F16 之间取平衡,适合显存约 3.5GB 的设备
  • 该仓库仅发布 GGUF,BF16、SFT、Midtrain 等权重需要去 ModelScope 对应仓库获取

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q40.9 GB1.5 GB2.5 GB8 GB文件 ↗
F161.2 GB1.5 GB2.5 GB8 GB文件 ↗
Q81.9 GB2.5 GB3.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2.5GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • Ollama 一键拉取并以本地服务方式运行
  • LM Studio 图形界面加载,适合不熟悉命令行的用户
  • llama.cpp 直接加载 GGUF,便于脚本化调用与二次开发
  • 其它 GGUF 兼容后端(如 koboldcpp 等)模型卡未具体列出

采用前要知道的限制

  • 仅 2B 参数,复杂推理与生成长文本质量仍弱于更大模型
  • 仓库仅含 GGUF 量化文件,不提供 BF16 完整权重或微调检查点
  • 模型卡未声明具体的推理速度、上下文实测表现与硬件基准
  • 训练语言以中英文为主,其它语言覆盖情况模型卡未说明