← 返回模型库

owao/Nanbeige4.2-3B-GGUF

Nanbeige4.2-3B-GGUF:3B参数中文轻量对话量化

Nanbeige4.2-3B-GGUF 是基于 Nanbeige4.2-3B 的 GGUF 量化合集,参数规模 3B,支持中英文文本生成。提供 Q2 到 Q8 共 8 档量化,适合硬件资源有限的本地用户。极小文件 Q2/Q3 适合老旧设备与最低 4GB 内存环境;Q5/Q6/Q8 保留更多质量但需要 3GB 以上显存。

中文对话小模型GGUF 量化轻量本地
查看模型源页面
下载量
0
参数
3B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,Nanbeige4.2-3B 是 3B 参数的中英双语模型,pipeline_tag 显示为文本生成,但上下文长度、训练数据、能力评测原模型卡未详细说明。量化仓库方面,owao 用户提供了从 Q2 到 Q8 共 8 档 GGUF 量化文件,覆盖从极低资源到接近原精度的需求。运行工具方面,兼容 llama.cpp、LM Studio 与 Ollama 三种推理框架,其中该仓库说明指出 Ollama 需使用其 fork 分支构建,主流 llama.cpp 路径可直接调用。

更适合谁

  • 硬件资源有限但希望本地运行中文对话模型的用户
  • 想在中英双语场景下测试小模型效果的爱好者
  • 需要多档量化灵活权衡体积与质量的低资源部署者
  • 想对比不同量化对小模型影响的研究者

典型使用场景

  • 本地中文与中英双语对话问答
  • 低硬件环境下的轻量级文本生成测试
  • 小模型不同量化档效果对比研究
  • 嵌入式或边缘设备上受限语言任务探索

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

3B 小参数量级

推理门槛低,便于在低配设备部署

中英双语支持

覆盖中文与英文常见对话场景

多档 GGUF 量化覆盖

从 Q2 到 Q8 八档可选,便于权衡体积与质量

第三方量化合集

文件齐全,可按需取用

硬件怎么准备

  • 仅 4GB 内存或 1GB 显存设备可加载 Q2 版本(0.75GB 文件),适合极低资源
  • 8GB 内存或 2GB 显存可承载 Q3 与 IQ4 系列(1.125–1.5GB),平衡体积与质量
  • 3GB 以上显存推荐 Q4_K_M 与 Q5_K_M(1.5–1.875GB),属于本地部署常用档位
  • 4.5GB 以上显存或 8GB 内存设备可选 Q6_K 与 Q8_0(2.25–3GB),尽可能接近原精度

量化版本怎么选

  • 极低配置老设备优先选择 Q2 或 IQ3_M,体积最小但模型卡未说明质量差异
  • 平衡选择 Q4_K_M 或 IQ4_NL,是本地小模型常见甜点档位
  • 显存充足且追求更高质量可选 Q5_K_M 或 Q6_K
  • 接近原精度可使用 Q8_0,但需更大显存或内存开销

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q20.7 GB1 GB2 GB8 GB文件 ↗
IQ31.0 GB1.5 GB2.5 GB8 GB文件 ↗
Q31.0 GB1.5 GB2.5 GB8 GB文件 ↗
IQ41.4 GB2 GB3 GB8 GB文件 ↗
Q41.4 GB2 GB3 GB8 GB文件 ↗
Q51.7 GB2 GB3 GB8 GB文件 ↗
Q62.1 GB2.5 GB3.5 GB8 GB文件 ↗
Q82.8 GB3.5 GB4.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • 使用 llama.cpp 直接运行各 GGUF 量化文件
  • 使用 LM Studio 加载并设置合适上下文与采样参数
  • 按该仓库说明使用 Ollama 时需从其 fork 分支构建
  • 通过 llama-cpp-python 集成到自有 Python 应用

采用前要知道的限制

  • 原模型卡未提供上下文长度、训练数据与能力评测细节
  • 原模型卡未说明模型的具体擅长任务与适用领域
  • 量化合集来自第三方用户,原模型卡未说明是否存在质量或速度差异
  • 部分量化档的实测表现与兼容性未在原模型卡中说明