下载量
0
参数
2.8B
上下文
未说明
架构 / 任务
vibevoice
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
本档案只覆盖 VibeVoice-ASR-BitNet 这一模型卡本身的能力、量化与运行选项。原始能力、多语种列表和 CPU 加速结论均直接来自模型卡与配置标签,模型卡未说明的部分需另行核实。仓库提供两类资产:一是现成可用的两个 GGUF 量化文件,二是 10.7 GB SafeTensors 原文件用于二次转换。运行时方面模型卡同时列出 llama.cpp、Ollama、LM Studio 三种兼容路径,因此量化版本既能走 CPU 推理也能加载到显存。
更适合谁
- 本地或离线需要做语音转文字的个人开发者
- 对隐私敏感、不能上传音频的用户
- 在边缘设备、笔记本或低算力服务器上做实时转写的项目
- 希望快速集成多语种 ASR 能力的中文或英文使用者
典型使用场景
- 会议录音、采访或讲座的本地离线转写
- 嵌入式设备或树莓派级别的端侧语音助手
- 不希望上传音频的隐私敏感场景如医疗、法律
- 多语种字幕生成或语音笔记应用
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
边缘 CPU 实时推理
模型卡主打无 GPU 的 CPU 实时转写,RTF 小于 1 即比音频流处理更快
多语种覆盖
模型卡明确支持英、中、法、意、韩、葡、越共七种语言
异构量化压缩
VAE 用 I8_S、LM decoder 用 I2_S+embed+Q6_K,从 4.62 GB 压到 1.58 GB
推理速度优势
模型卡给出比 Whisper.cpp 快 1.6 到 2.3 倍的 CPU 对比数据
硬件怎么准备
- 4 GB 内存可加载任一单文件,8 GB 内存可同时容纳 VAE 与 LM 解码器
- 推荐显存 3 到 3.5 GB 可完整加载两个 GGUF 文件
- 主要面向 CPU 推理,独立显卡并非必需
- 模型卡未说明对 AVX、AVX2 等指令集的具体要求
量化版本怎么选
- 仓库默认提供 I8_S 的 VAE tokenizer 与 I2_S+embed+Q6_K 的 LM decoder,无需自行转换
- 两个文件需同时加载才能完成完整转写流水线
- 需要其他精度可下载 10.7 GB SafeTensors 原文件自行转换
- 模型卡未列出其它量化档位
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 2GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3GB。
阅读 4GB 显存选型指南 →可以怎样运行
- 通过 llama.cpp 加载两个 GGUF 文件按模型卡流程推理
- 通过 Ollama 拉取并按模型卡指引运行
- 在 LM Studio 中导入 GGUF 作为 CPU 或 GPU 推理后端
- 模型卡未提供 Python 推理脚本示例
采用前要知道的限制
- 实际延迟受 CPU 核心数与指令集影响,模型卡未承诺消费级 CPU 具体表现
- 压缩版在部分基准上略低于 7B 原版或其他 ASR 系统
- 模型卡未公开上下文长度、可处理音频时长等参数
- ASR 以外能力如翻译、说话人区分模型卡未说明