下载量
0
参数
1B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库是 GnLOLot 在 OpenBMB MiniCPM5-1B 基础上用 Fable 5 数据微调后发布的 GGUF 量化分发包,原始模型能力包括思维链推理、代码生成、调试工作流与指令跟随,上下文窗口源自上游 config.json 的 128K tokens。仓库本身不提供新能力,仅提供 Q4_K_M、Q5_K_M、Q8_0、F16 四种 llama.cpp 兼容量化。模型卡未说明训练数据细节与第三方基准成绩。运行工具覆盖 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等 GGUF 推理前端。
更适合谁
- 低显存设备的本地部署用户
- 想要离线运行思维链推理的使用者
- 寻找轻量代码助手或调试工具的开发者
- 本地中英文对话实验的个人玩家
典型使用场景
- 本地代码片段生成与 bug 排查
- 思维链问答与多步推理实验
- 离线中英文对话与指令执行
- 低显存设备上的轻量文本生成与原型验证
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
思维链推理
内置 MiniCPM5 聊天模板,默认开启 Think 模式,可输出推理块
代码能力
代码生成、调试和软件工程任务微调
指令跟随
Fable 5 数据微调,对用户提示和任务约束响应更稳定
长上下文窗口
源自上游 config.json,支持 128K tokens
轻量部署
1B 参数规模,Q4 量化仅约 657MB
硬件怎么准备
- Q4_K_M 量化约 657MB,最低 4GB 内存或 1GB 显存,推荐 8GB 内存
- Q5_K_M 量化约 751MB,最低 4GB 内存或 1GB 显存,推荐 8GB 内存
- Q8_0 量化约 1.1GB,最低 4GB 内存或 1.5GB 显存,推荐 8GB 内存或 2.5GB 显存
- F16 量化约 2.1GB,最低 4GB 内存,推荐 8GB 内存或 2GB 显存
量化版本怎么选
- 显存紧张或追求最小体积选 Q4_K_M
- 平衡质量与体积可选 Q5_K_M
- 模型卡推荐 Q8_0 为默认量化,质量接近 F16 且体积更小
- F16 适合需要无损参考对比或显存充足的场景
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。
阅读 4GB 显存选型指南 →可以怎样运行
- llama.cpp 的 llama-cli 命令行推理
- llama.cpp server 起本地 OpenAI 兼容 API
- LM Studio、jan、KoboldCpp 等图形界面加载 gguf
- Ollama 拉取并直接运行
采用前要知道的限制
- 1B 参数规模,非前沿级别模型
- 思维链模式下可能先输出推理块再给最终答案
- 实际可用上下文取决于 GGUF 运行时与硬件上限
- 模型卡未提供第三方基准成绩与训练数据细节