Skip to content

建议:增加 FunASR SenseVoice 引擎选项 #27

Description

@LauraGPT

Note

许可证与能力更正(2026-07-14): FunASR 是工具箱,不是单一模型。FunASRSenseVoice 仓库源码采用 MIT;模型权重以各自模型卡为准。SenseVoiceSmall 支持中文、粤语、英语、日语和韩语,权重使用模型卡链接的 FunASR 模型开源协议;Fun-ASR-Nano-2512 为 Apache-2.0。语言范围、标点和性能取决于所选模型及运行配置。

VideoSubtitleGenerator 是非常好用的批量字幕工具!

建议增加 FunASR SenseVoice 作为可选的语音识别引擎。SenseVoice 在中文字幕场景有显著优势:

  • 中文准确率更高:CER 3.2%(AISHELL),远优于 Whisper 的 8.4%
  • 速度快 10 倍以上:非自回归架构,GPU 推理 170x 实时
  • 内置标点和 VAD:无需额外后处理
  • 模型更小:234M 参数(vs Whisper large 1.5B),显存需求低

集成非常简单:

pip install funasr

from funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall", vad_model="fsmn-vad")
result = model.generate(input="audio.wav")

VAD 切分 + 时间戳输出天然适合字幕生成。

参考:

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions