← 返回模型库

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF

MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:本地1B轻量思维链代码模型

面向本地部署的 1B 参数轻量文本生成模型,基于 MiniCPM5-1B 在 Fable 5 数据上微调,支持思维链推理、代码生成与指令跟随,上下文最长 128K tokens。适合硬件受限、需要离线跑思维链问答或编程任务的个人开发者,最低 4GB 内存即可加载 Q4 量化版本,无需高端显卡。

1B轻量模型本地代码助手思维链推理GGUF量化
查看模型源页面
下载量
0
参数
1B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库是 GnLOLot 在 OpenBMB MiniCPM5-1B 基础上用 Fable 5 数据微调后发布的 GGUF 量化分发包,原始模型能力包括思维链推理、代码生成、调试工作流与指令跟随,上下文窗口源自上游 config.json 的 128K tokens。仓库本身不提供新能力,仅提供 Q4_K_M、Q5_K_M、Q8_0、F16 四种 llama.cpp 兼容量化。模型卡未说明训练数据细节与第三方基准成绩。运行工具覆盖 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等 GGUF 推理前端。

更适合谁

  • 低显存设备的本地部署用户
  • 想要离线运行思维链推理的使用者
  • 寻找轻量代码助手或调试工具的开发者
  • 本地中英文对话实验的个人玩家

典型使用场景

  • 本地代码片段生成与 bug 排查
  • 思维链问答与多步推理实验
  • 离线中英文对话与指令执行
  • 低显存设备上的轻量文本生成与原型验证

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

思维链推理

内置 MiniCPM5 聊天模板,默认开启 Think 模式,可输出推理块

代码能力

代码生成、调试和软件工程任务微调

指令跟随

Fable 5 数据微调,对用户提示和任务约束响应更稳定

长上下文窗口

源自上游 config.json,支持 128K tokens

轻量部署

1B 参数规模,Q4 量化仅约 657MB

硬件怎么准备

  • Q4_K_M 量化约 657MB,最低 4GB 内存或 1GB 显存,推荐 8GB 内存
  • Q5_K_M 量化约 751MB,最低 4GB 内存或 1GB 显存,推荐 8GB 内存
  • Q8_0 量化约 1.1GB,最低 4GB 内存或 1.5GB 显存,推荐 8GB 内存或 2.5GB 显存
  • F16 量化约 2.1GB,最低 4GB 内存,推荐 8GB 内存或 2GB 显存

量化版本怎么选

  • 显存紧张或追求最小体积选 Q4_K_M
  • 平衡质量与体积可选 Q5_K_M
  • 模型卡推荐 Q8_0 为默认量化,质量接近 F16 且体积更小
  • F16 适合需要无损参考对比或显存充足的场景

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q40.5 GB1 GB2 GB8 GB文件 ↗
F160.6 GB1 GB2 GB8 GB文件 ↗
Q50.6 GB1 GB2 GB8 GB文件 ↗
Q80.9 GB1.5 GB2.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • llama.cpp 的 llama-cli 命令行推理
  • llama.cpp server 起本地 OpenAI 兼容 API
  • LM Studio、jan、KoboldCpp 等图形界面加载 gguf
  • Ollama 拉取并直接运行

采用前要知道的限制

  • 1B 参数规模,非前沿级别模型
  • 思维链模式下可能先输出推理块再给最终答案
  • 实际可用上下文取决于 GGUF 运行时与硬件上限
  • 模型卡未提供第三方基准成绩与训练数据细节