← 返回模型库

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版

基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。

本地 1B 小模型工具调用思考模式长上下文
查看模型源页面
下载量
0
参数
1B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型本体是 GnLOLot 在 openbmb/MiniCPM5-1B 之上用 Fable 5 数据二次微调的 1B 文本生成模型,模型卡和标签显示它强调思考模式、工具调用、代码与指令跟随等能力。本仓库是 llama.cpp 量化发布版,并非新模型,提供 Q8_0 与 F16 两种 GGUF 文件。运行层面支持 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等主流 GGUF 推理工具。多语言覆盖、上下文长度等更多细节模型卡未单独说明。

更适合谁

  • 想要在本地运行轻量小模型做日常对话的用户
  • 需要在低显存设备上体验工具调用与函数调用的开发者
  • 想尝试思考链推理和长上下文实验的玩家
  • 有中英双语本地化部署需求的用户

典型使用场景

  • 本地对话与日常问答
  • 代码生成与调试辅助
  • 函数调用、工具调用相关实验
  • 长文档上下文读取与摘要测试

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

思考模式

内置 MiniCPM5 聊天模板的链式思考推理能力

工具调用增强

V2 相比 V1 加强函数调用与工具使用表现

长上下文

支持最长 128K(131,072)token 输入

轻量部署

1B 参数可在 1.5GB 显存上以 Q8_0 加载

中英双语

同时覆盖中文与英文对话与指令

硬件怎么准备

  • 1GB 显存或以上即可尝试加载 F16 全精度版本
  • 1.5GB 显存或以上可加载 Q8_0 量化版本
  • 推荐 8GB 内存配合 2GB 以上显存以获得稳定推理体验
  • 普通笔记本、迷你主机或入门级独显均可本地运行

量化版本怎么选

  • Q8_0 文件约 1.1GB,是仓库推荐的默认量化
  • F16 文件约 2.1GB,适合追求更低量化损失的本地全精度体验
  • 显存紧张时优先选 Q8_0,资源充足时可考虑 F16
  • 仓库只提供这两种 GGUF 文件,更低比特量化模型卡未提供

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
F160.6 GB1 GB2 GB8 GB文件 ↗
Q80.9 GB1.5 GB2.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • llama.cpp 命令行 llama-cli 或 llama-server
  • Ollama 本地加载
  • LM Studio、jan、KoboldCpp 等 GGUF 兼容界面
  • 其他支持 GGUF 元数据中 MiniCPM5 聊天模板的推理工具

采用前要知道的限制

  • 1B 规模属轻量级本地模型,整体能力不及前沿大模型
  • 可能输出思考过程块,需要按聊天模板解析最终回答
  • 实际可用上下文长度取决于推理工具和硬件条件,模型卡未承诺具体速度
  • 模型卡未提供图片、音频等其他模态支持说明