下载量
0
参数
2B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自同名 2B 稠密 LlamaForCausalLM,定位本地助手、长上下文、工具与 Agent 场景;该 GGUF 仓库仅发布量化文件,不含 BF16、SFT、Midtrain 等中间检查点,这些权重需到 ModelScope 对应仓库获取。仓库同时兼容 llama.cpp、Ollama、LM Studio 三类常见本地工具,但 DSpark 推测解码草案模型与 GPTQ、MLX、LiteRT 等格式不在此仓库内。模型卡未给出具体的解码速度或端到端延迟数据。
更适合谁
- 想在消费级笔记本或台式机上自托管中文助手的个人开发者与本地 AI 爱好者
- 需要在边缘设备或低显存机器上跑长文档问答、代码补全与工具调用的用户
- 对数据隐私有要求、希望离线运行的中小团队与研究者
- 研究 2B 级稠密模型在 Agent、Tool Use、长上下文场景表现的用户
典型使用场景
- 中文长文档摘要、跨段落问答与多轮长上下文对话
- 本地代码补全、代码理解与小型 Agent 工作流
- 工具调用型聊天助手,例如让模型调用本地脚本或外部 API
- 边缘设备或资源受限场景下的轻量推理应用与离线问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
原生长上下文
原生 131,072 token 上下文窗口,适合长文档与多轮 Agent 任务
2B 级开源 SOTA
在同尺寸开源对比中平均得分 53.9,超过多数被列出的 4B 级参考模型
代码与数学强项
训练数据包含 UltraData-Code、UltraData-Math,并在 LiveCodeBench、MATH-500、AIME 等榜单相对同尺寸模型有明显优势
工具与 Agent 能力
训练数据包含 UltraData-SFT-Agent-2609 等 500K Agent 样本,主打工具调用与多步代理
端侧友好部署
2.5B 参数、Q4_K_M 仅约 1GB,最低 1.5GB 显存即可加载运行
硬件怎么准备
- 至少 4GB 内存 + 1.5GB 显存即可加载 Q4_K_M 版本,文件约 1GB
- 推荐配置 8GB 内存 + 2.5GB 显存,便于运行 Q4_K_M 或 F16 版本(文件约 1.25GB)并保留余量
- 想跑 Q8_0 版本(文件约 2GB)建议显存 3.5GB 以上
- 纯 CPU 推理可走 llama.cpp 或 Ollama,模型卡未给出具体速度数据
量化版本怎么选
- 显存紧张或机器较旧时优先选 Q4_K_M,体积与质量折中较好
- 想尽量保留原始能力且显存够用时选 F16,避免量化损失
- Q8_0 在 Q4 与 F16 之间取平衡,适合显存约 3.5GB 的设备
- 该仓库仅发布 GGUF,BF16、SFT、Midtrain 等权重需要去 ModelScope 对应仓库获取
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 1.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2.5GB。
阅读 4GB 显存选型指南 →可以怎样运行
- Ollama 一键拉取并以本地服务方式运行
- LM Studio 图形界面加载,适合不熟悉命令行的用户
- llama.cpp 直接加载 GGUF,便于脚本化调用与二次开发
- 其它 GGUF 兼容后端(如 koboldcpp 等)模型卡未具体列出
采用前要知道的限制
- 仅 2B 参数,复杂推理与生成长文本质量仍弱于更大模型
- 仓库仅含 GGUF 量化文件,不提供 BF16 完整权重或微调检查点
- 模型卡未声明具体的推理速度、上下文实测表现与硬件基准
- 训练语言以中英文为主,其它语言覆盖情况模型卡未说明