← 返回模型库

microsoft/VibeVoice-ASR-BitNet

VibeVoice-ASR-BitNet:边缘CPU实时多语种语音转写模型

VibeVoice-ASR-BitNet 是微软推出的 2.8B 参数语音识别压缩版本,主打边缘CPU实时推理,无需独立显卡。它把原始模型从 4.62 GB 压到约 1.58 GB,模型卡显示 CPU 上比 Whisper.cpp 快 1.6 到 2.3 倍,支持中英法意韩葡越等多语种转写。

语音转文字多语种 ASRCPU 推理边缘部署
查看模型源页面
下载量
0
参数
2.8B
上下文
未说明
架构 / 任务
vibevoice
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

本档案只覆盖 VibeVoice-ASR-BitNet 这一模型卡本身的能力、量化与运行选项。原始能力、多语种列表和 CPU 加速结论均直接来自模型卡与配置标签,模型卡未说明的部分需另行核实。仓库提供两类资产:一是现成可用的两个 GGUF 量化文件,二是 10.7 GB SafeTensors 原文件用于二次转换。运行时方面模型卡同时列出 llama.cpp、Ollama、LM Studio 三种兼容路径,因此量化版本既能走 CPU 推理也能加载到显存。

更适合谁

  • 本地或离线需要做语音转文字的个人开发者
  • 对隐私敏感、不能上传音频的用户
  • 在边缘设备、笔记本或低算力服务器上做实时转写的项目
  • 希望快速集成多语种 ASR 能力的中文或英文使用者

典型使用场景

  • 会议录音、采访或讲座的本地离线转写
  • 嵌入式设备或树莓派级别的端侧语音助手
  • 不希望上传音频的隐私敏感场景如医疗、法律
  • 多语种字幕生成或语音笔记应用

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

边缘 CPU 实时推理

模型卡主打无 GPU 的 CPU 实时转写,RTF 小于 1 即比音频流处理更快

多语种覆盖

模型卡明确支持英、中、法、意、韩、葡、越共七种语言

异构量化压缩

VAE 用 I8_S、LM decoder 用 I2_S+embed+Q6_K,从 4.62 GB 压到 1.58 GB

推理速度优势

模型卡给出比 Whisper.cpp 快 1.6 到 2.3 倍的 CPU 对比数据

硬件怎么准备

  • 4 GB 内存可加载任一单文件,8 GB 内存可同时容纳 VAE 与 LM 解码器
  • 推荐显存 3 到 3.5 GB 可完整加载两个 GGUF 文件
  • 主要面向 CPU 推理,独立显卡并非必需
  • 模型卡未说明对 AVX、AVX2 等指令集的具体要求

量化版本怎么选

  • 仓库默认提供 I8_S 的 VAE tokenizer 与 I2_S+embed+Q6_K 的 LM decoder,无需自行转换
  • 两个文件需同时加载才能完成完整转写流水线
  • 需要其他精度可下载 10.7 GB SafeTensors 原文件自行转换
  • 模型卡未列出其它量化档位

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF1.6 GB2 GB3 GB8 GB文件 ↗
Q62.0 GB2.5 GB3.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 2GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • 通过 llama.cpp 加载两个 GGUF 文件按模型卡流程推理
  • 通过 Ollama 拉取并按模型卡指引运行
  • 在 LM Studio 中导入 GGUF 作为 CPU 或 GPU 推理后端
  • 模型卡未提供 Python 推理脚本示例

采用前要知道的限制

  • 实际延迟受 CPU 核心数与指令集影响,模型卡未承诺消费级 CPU 具体表现
  • 压缩版在部分基准上略低于 7B 原版或其他 ASR 系统
  • 模型卡未公开上下文长度、可处理音频时长等参数
  • ASR 以外能力如翻译、说话人区分模型卡未说明