下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
other
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,NVIDIA-Nemotron-3.5-Lightning-30B-A3B 是 NVIDIA 推出的通用推理与对话模型,主打 Mamba-2+MoE+Attention 混合架构、3B 激活带来的高效推理,以及最高 1M token 的长上下文能力,支持工具调用与可配置的思考模式。本 GGUF 仓库为社区量化版本,由 unsloth 维护,覆盖 IQ1 至 Q8 与 BF16 全精度,与官方 NVFP4 部署版本互补:BF16 适合后训练与定制研究,NVFP4 适合数据中心直接推理,GGUF 适合本地消费级硬件与 llama.cpp/ollama 生态。
更适合谁
- 拥有至少 8GB 显存或 16GB 内存、希望本地尝试 30B 参数 MoE 模型的开发者
- 想在本地做多语言文本生成、代码与工具调用实验的研究者
- 需要长上下文窗口但不便部署完整 BF16 权重的硬件爱好者
- 想对 Nemotron 系列做后训练、蒸馏或量化对比的工程师
典型使用场景
- 本地多语言对话与文本生成
- 代码生成、调试与编程辅助
- 工具调用与简单代理工作流试验
- 长文档摘要与多文档聚合检索任务
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
混合 MoE 架构
30B 总参数下仅激活 3B,兼顾容量与推理效率
超长上下文
模型卡说明支持最高 1M token 的上下文长度
多语言能力
支持英、西、法、德、意、日等语言,中文出现于后训练语料
可配置推理
支持通过 chat template 开关思考模式与思考预算
工具调用
模型卡明确支持工具调用与代理场景
硬件怎么准备
- 显存约 4–8GB 的入门显卡可尝试 IQ1/IQ2 极低比特,模型卡未说明速度
- 显存 12GB 左右的消费级显卡可加载 IQ3/Q3_K_XL
- 显存 16GB 及以上可使用 IQ4_NL 或 Q4_K_M
- 显存 24GB 以上或内存 32GB 以上可尝试 Q6_K_XL、Q8_0 或 BF16
量化版本怎么选
- 硬件极度紧张时优先 IQ1_M 或 IQ2_M,但模型卡未保证质量
- 多数本地场景推荐 IQ4_NL 或 Q4_K_M,容量与质量较平衡
- 想尽量贴近原版可选 Q6_K_XL 或 BF16 全精度
- 显存充裕且追求精度可选 Q8_0
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ1 | 3.5 GB | 4 GB | 5 GB | 8 GB | 文件 ↗ |
| IQ2 | 7.0 GB | 8 GB | 9.5 GB | 10.5 GB | 文件 ↗ |
| IQ3 | 10 GB | 11.5 GB | 13.5 GB | 16 GB | 文件 ↗ |
| Q3 | 10 GB | 11.5 GB | 13.5 GB | 16 GB | 文件 ↗ |
| IQ4 | 14 GB | 15.5 GB | 18 GB | 21 GB | 文件 ↗ |
| Q4 | 14 GB | 15.5 GB | 18 GB | 21 GB | 文件 ↗ |
| BF16 | 17 GB | 19 GB | 22 GB | 26.5 GB | 文件 ↗ |
| GGUF | 17 GB | 19 GB | 22 GB | 26.5 GB | 文件 ↗ |
| Q5 | 17 GB | 19 GB | 22 GB | 26.5 GB | 文件 ↗ |
| Q6 | 21 GB | 23 GB | 26.5 GB | 31.5 GB | 文件 ↗ |
| Q8 | 28 GB | 30.5 GB | 35 GB | 42 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 4GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 通过 ollama 拉取并运行
- 通过 LM Studio 加载 GGUF 文件
- 通过 llama.cpp 或兼容后端本地推理
- 模型卡推荐的生产部署路径是 vLLM Nightly 与 NVFP4 版本
采用前要知道的限制
- 模型卡未将中文列为主支持语言,多语言偏英欧日
- IQ1/IQ2 等极低比特会显著影响输出质量,模型卡未给出保证
- 本仓库为社区量化,原生推荐部署路径是 NVFP4
- 商业使用须遵守 OpenMDW-1.1 许可条款