下载量
0
参数
1B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型本体是 GnLOLot 在 openbmb/MiniCPM5-1B 之上用 Fable 5 数据二次微调的 1B 文本生成模型,模型卡和标签显示它强调思考模式、工具调用、代码与指令跟随等能力。本仓库是 llama.cpp 量化发布版,并非新模型,提供 Q8_0 与 F16 两种 GGUF 文件。运行层面支持 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等主流 GGUF 推理工具。多语言覆盖、上下文长度等更多细节模型卡未单独说明。
更适合谁
- 想要在本地运行轻量小模型做日常对话的用户
- 需要在低显存设备上体验工具调用与函数调用的开发者
- 想尝试思考链推理和长上下文实验的玩家
- 有中英双语本地化部署需求的用户
典型使用场景
- 本地对话与日常问答
- 代码生成与调试辅助
- 函数调用、工具调用相关实验
- 长文档上下文读取与摘要测试
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
思考模式
内置 MiniCPM5 聊天模板的链式思考推理能力
工具调用增强
V2 相比 V1 加强函数调用与工具使用表现
长上下文
支持最长 128K(131,072)token 输入
轻量部署
1B 参数可在 1.5GB 显存上以 Q8_0 加载
中英双语
同时覆盖中文与英文对话与指令
硬件怎么准备
- 1GB 显存或以上即可尝试加载 F16 全精度版本
- 1.5GB 显存或以上可加载 Q8_0 量化版本
- 推荐 8GB 内存配合 2GB 以上显存以获得稳定推理体验
- 普通笔记本、迷你主机或入门级独显均可本地运行
量化版本怎么选
- Q8_0 文件约 1.1GB,是仓库推荐的默认量化
- F16 文件约 2.1GB,适合追求更低量化损失的本地全精度体验
- 显存紧张时优先选 Q8_0,资源充足时可考虑 F16
- 仓库只提供这两种 GGUF 文件,更低比特量化模型卡未提供
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。
阅读 4GB 显存选型指南 →可以怎样运行
- llama.cpp 命令行 llama-cli 或 llama-server
- Ollama 本地加载
- LM Studio、jan、KoboldCpp 等 GGUF 兼容界面
- 其他支持 GGUF 元数据中 MiniCPM5 聊天模板的推理工具
采用前要知道的限制
- 1B 规模属轻量级本地模型,整体能力不及前沿大模型
- 可能输出思考过程块,需要按聊天模板解析最终回答
- 实际可用上下文长度取决于推理工具和硬件条件,模型卡未承诺具体速度
- 模型卡未提供图片、音频等其他模态支持说明