← 返回模型库

unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:30B MoE混合架构多语言推理底座

30B 总参数、3B 激活的 NVIDIA 混合架构模型,结合 Mamba-2、MoE 与 Attention 层,支持长上下文与工具调用。仓库提供 IQ1 到 Q8 多档 GGUF 量化,IQ1 最低约 4GB 显存即可加载,桌面显卡也能尝试低比特版本。

MoE混合架构多语言推理长上下文工具调用
查看模型源页面
下载量
0
参数
30B
上下文
未说明
架构 / 任务
未分类
许可证
other

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,NVIDIA-Nemotron-3.5-Lightning-30B-A3B 是 NVIDIA 推出的通用推理与对话模型,主打 Mamba-2+MoE+Attention 混合架构、3B 激活带来的高效推理,以及最高 1M token 的长上下文能力,支持工具调用与可配置的思考模式。本 GGUF 仓库为社区量化版本,由 unsloth 维护,覆盖 IQ1 至 Q8 与 BF16 全精度,与官方 NVFP4 部署版本互补:BF16 适合后训练与定制研究,NVFP4 适合数据中心直接推理,GGUF 适合本地消费级硬件与 llama.cpp/ollama 生态。

更适合谁

  • 拥有至少 8GB 显存或 16GB 内存、希望本地尝试 30B 参数 MoE 模型的开发者
  • 想在本地做多语言文本生成、代码与工具调用实验的研究者
  • 需要长上下文窗口但不便部署完整 BF16 权重的硬件爱好者
  • 想对 Nemotron 系列做后训练、蒸馏或量化对比的工程师

典型使用场景

  • 本地多语言对话与文本生成
  • 代码生成、调试与编程辅助
  • 工具调用与简单代理工作流试验
  • 长文档摘要与多文档聚合检索任务

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

混合 MoE 架构

30B 总参数下仅激活 3B,兼顾容量与推理效率

超长上下文

模型卡说明支持最高 1M token 的上下文长度

多语言能力

支持英、西、法、德、意、日等语言,中文出现于后训练语料

可配置推理

支持通过 chat template 开关思考模式与思考预算

工具调用

模型卡明确支持工具调用与代理场景

硬件怎么准备

  • 显存约 4–8GB 的入门显卡可尝试 IQ1/IQ2 极低比特,模型卡未说明速度
  • 显存 12GB 左右的消费级显卡可加载 IQ3/Q3_K_XL
  • 显存 16GB 及以上可使用 IQ4_NL 或 Q4_K_M
  • 显存 24GB 以上或内存 32GB 以上可尝试 Q6_K_XL、Q8_0 或 BF16

量化版本怎么选

  • 硬件极度紧张时优先 IQ1_M 或 IQ2_M,但模型卡未保证质量
  • 多数本地场景推荐 IQ4_NL 或 Q4_K_M,容量与质量较平衡
  • 想尽量贴近原版可选 Q6_K_XL 或 BF16 全精度
  • 显存充裕且追求精度可选 Q8_0

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ13.5 GB4 GB5 GB8 GB文件 ↗
IQ27.0 GB8 GB9.5 GB10.5 GB文件 ↗
IQ310 GB11.5 GB13.5 GB16 GB文件 ↗
Q310 GB11.5 GB13.5 GB16 GB文件 ↗
IQ414 GB15.5 GB18 GB21 GB文件 ↗
Q414 GB15.5 GB18 GB21 GB文件 ↗
BF1617 GB19 GB22 GB26.5 GB文件 ↗
GGUF17 GB19 GB22 GB26.5 GB文件 ↗
Q517 GB19 GB22 GB26.5 GB文件 ↗
Q621 GB23 GB26.5 GB31.5 GB文件 ↗
Q828 GB30.5 GB35 GB42 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 4GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 通过 ollama 拉取并运行
  • 通过 LM Studio 加载 GGUF 文件
  • 通过 llama.cpp 或兼容后端本地推理
  • 模型卡推荐的生产部署路径是 vLLM Nightly 与 NVFP4 版本

采用前要知道的限制

  • 模型卡未将中文列为主支持语言,多语言偏英欧日
  • IQ1/IQ2 等极低比特会显著影响输出质量,模型卡未给出保证
  • 本仓库为社区量化,原生推荐部署路径是 NVFP4
  • 商业使用须遵守 OpenMDW-1.1 许可条款