下载量
0
参数
0.6B
上下文
未说明
架构 / 任务
nemotron3_5_asr
许可证
other
MODEL POSITIONING
这个模型解决什么问题?
模型能力来源于模型卡与标签:作为多语种流式 ASR(自动语音识别)模型,强调缓存感知流式编码器与 RNN-T 解码器,并使用语言 ID 提示条件在同一模型内完成多语种转录,可自动检测语种或显式指定目标语言;输出文字自带标点与大小写。量化仓库由 Hugging Face 上的 GGUF 文件提供,当前公开记录仅有一种 Q8 量化(约 600MB)。运行工具支持 Hugging Face Transformers、Ollama、llama.cpp 与 LM Studio,原生集成则面向 NVIDIA NeMo 与 NeMo-Speech.cpp。模型卡明确指明硬件微架构覆盖 NVIDIA Volta 到 Blackwell 及 Jetson 系列,操作系统为 Linux。
更适合谁
- 需要多语种实时或批量语音转文字的开发者与语音团队
- 搭建低延迟语音代理、字幕生成、客服录音转写的工程团队
- 中文用户且具备英伟达 GPU 或充足通用内存希望本地运行者
- 希望用单一模型覆盖欧洲、东亚、南亚等地区语种的产品
典型使用场景
- 实时会议与直播多语种字幕生成
- 语音助手与电话客服的流式转写
- 多语种音视频资料批量离线转录
- 混语种语音流自动标注与归档
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多语种覆盖
单模型支持 40 种语言-地区,19 种开箱即用,13 种广覆盖,8 种需微调
流式低延迟
缓存感知 FastConformer 设计避免重叠计算,分块可配置 80–1120 毫秒
语种自动检测
支持自动识别语种并在输出末尾附带语种标签,便于混语种场景
标点与大小写
输出文本原生包含标点与大小写,无需后处理
量化轻量
仅约 0.6B 参数,Q8 量化文件约 600MB,硬件门槛低
硬件怎么准备
- 最低配置可参考 Q8 GGUF 文件建议:内存 4GB、显存 1GB
- 推荐配置为内存 8GB、显存 2GB 以保证多语种流式处理稳定
- 模型卡说明原生支持 NVIDIA Volta/ Turing/ Ampere/ Lovelace/ Hopper/ Blackwell 与 Jetson 系列 GPU
- 模型卡未说明 CPU/集成显卡等通用硬件的实时速度与并发能力
量化版本怎么选
- 当前 GGUF 仓库仅记录 Q8 量化版本,文件约 600MB
- Q8 对 0.6B 参数模型而言已属高质量量化,精度损失通常较小
- 若显存紧张,可关注后续社区发布的更低比特量化;模型卡未承诺具体比特版本的兼容性与速度
- 同一仓库未列出其他 GGUF 变体,不建议自行假设存在未列出的量化选项
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q8 | 0.6 GB | 1 GB | 2 GB | 8 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。
阅读 4GB 显存选型指南 →可以怎样运行
- 通过 llama.cpp/Ollama/LM Studio 加载 Q8 GGUF 文件本地推理
- 使用 Hugging Face Transformers(v5.13.0 及以上)的 Nemotron3_5Asr 模型
- 通过 NVIDIA NeMo 进行训练、微调与离线/流式推理
- 使用 NeMo-Speech.cpp 原生 C++ 运行时进行本地推理
采用前要知道的限制
- 模型卡未提供 CPU 与非英伟达硬件的实时速度与并发数据
- 8 种语言为适配就绪档,未微调直接使用效果受限
- 公开 GGUF 仓库仅记录 Q8 单一量化,缺少更低比特或更多对比
- 性能数据来自 FLEURS 测试集,实际业务场景需自行评估