← 返回模型库

nvidia/nemotron-3.5-asr-streaming-0.6b

nemotron-3.5-asr-streaming-0.6b:0.6B 参数多语种流式语音转文字模型

NVIDIA 推出的 0.6B 参数多语种流式语音识别模型,基于缓存感知 FastConformer-RNNT 架构,原生支持 40 种语言-地区转录,可配置 80 毫秒到 1120 毫秒分块以在延迟与精度间权衡。适合需要多语种实时字幕、语音代理、跨语种转写或多语种批量转录的开发者与团队,输出自带大小写与标点。

多语种语音识别流式 ASR语音转文字
查看模型源页面
下载量
0
参数
0.6B
上下文
未说明
架构 / 任务
nemotron3_5_asr
许可证
other

MODEL POSITIONING

这个模型解决什么问题?

模型能力来源于模型卡与标签:作为多语种流式 ASR(自动语音识别)模型,强调缓存感知流式编码器与 RNN-T 解码器,并使用语言 ID 提示条件在同一模型内完成多语种转录,可自动检测语种或显式指定目标语言;输出文字自带标点与大小写。量化仓库由 Hugging Face 上的 GGUF 文件提供,当前公开记录仅有一种 Q8 量化(约 600MB)。运行工具支持 Hugging Face Transformers、Ollama、llama.cpp 与 LM Studio,原生集成则面向 NVIDIA NeMo 与 NeMo-Speech.cpp。模型卡明确指明硬件微架构覆盖 NVIDIA Volta 到 Blackwell 及 Jetson 系列,操作系统为 Linux。

更适合谁

  • 需要多语种实时或批量语音转文字的开发者与语音团队
  • 搭建低延迟语音代理、字幕生成、客服录音转写的工程团队
  • 中文用户且具备英伟达 GPU 或充足通用内存希望本地运行者
  • 希望用单一模型覆盖欧洲、东亚、南亚等地区语种的产品

典型使用场景

  • 实时会议与直播多语种字幕生成
  • 语音助手与电话客服的流式转写
  • 多语种音视频资料批量离线转录
  • 混语种语音流自动标注与归档

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多语种覆盖

单模型支持 40 种语言-地区,19 种开箱即用,13 种广覆盖,8 种需微调

流式低延迟

缓存感知 FastConformer 设计避免重叠计算,分块可配置 80–1120 毫秒

语种自动检测

支持自动识别语种并在输出末尾附带语种标签,便于混语种场景

标点与大小写

输出文本原生包含标点与大小写,无需后处理

量化轻量

仅约 0.6B 参数,Q8 量化文件约 600MB,硬件门槛低

硬件怎么准备

  • 最低配置可参考 Q8 GGUF 文件建议:内存 4GB、显存 1GB
  • 推荐配置为内存 8GB、显存 2GB 以保证多语种流式处理稳定
  • 模型卡说明原生支持 NVIDIA Volta/ Turing/ Ampere/ Lovelace/ Hopper/ Blackwell 与 Jetson 系列 GPU
  • 模型卡未说明 CPU/集成显卡等通用硬件的实时速度与并发能力

量化版本怎么选

  • 当前 GGUF 仓库仅记录 Q8 量化版本,文件约 600MB
  • Q8 对 0.6B 参数模型而言已属高质量量化,精度损失通常较小
  • 若显存紧张,可关注后续社区发布的更低比特量化;模型卡未承诺具体比特版本的兼容性与速度
  • 同一仓库未列出其他 GGUF 变体,不建议自行假设存在未列出的量化选项

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q80.6 GB1 GB2 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • 通过 llama.cpp/Ollama/LM Studio 加载 Q8 GGUF 文件本地推理
  • 使用 Hugging Face Transformers(v5.13.0 及以上)的 Nemotron3_5Asr 模型
  • 通过 NVIDIA NeMo 进行训练、微调与离线/流式推理
  • 使用 NeMo-Speech.cpp 原生 C++ 运行时进行本地推理

采用前要知道的限制

  • 模型卡未提供 CPU 与非英伟达硬件的实时速度与并发数据
  • 8 种语言为适配就绪档,未微调直接使用效果受限
  • 公开 GGUF 仓库仅记录 Q8 单一量化,缺少更低比特或更多对比
  • 性能数据来自 FLEURS 测试集,实际业务场景需自行评估