VideoSubtitleGenerator 是非常好用的批量字幕工具!
建议增加 FunASR SenseVoice 作为可选的语音识别引擎。SenseVoice 在中文字幕场景有显著优势:
- 中文准确率更高:CER 3.2%(AISHELL),远优于 Whisper 的 8.4%
- 速度快 10 倍以上:非自回归架构,GPU 推理 170x 实时
- 内置标点和 VAD:无需额外后处理
- 模型更小:234M 参数(vs Whisper large 1.5B),显存需求低
集成非常简单:
pip install funasr
from funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall", vad_model="fsmn-vad")
result = model.generate(input="audio.wav")
VAD 切分 + 时间戳输出天然适合字幕生成。
参考:
Note
许可证与能力更正(2026-07-14): FunASR 是工具箱,不是单一模型。FunASR 与 SenseVoice 仓库源码采用 MIT;模型权重以各自模型卡为准。SenseVoiceSmall 支持中文、粤语、英语、日语和韩语,权重使用模型卡链接的 FunASR 模型开源协议;Fun-ASR-Nano-2512 为 Apache-2.0。语言范围、标点和性能取决于所选模型及运行配置。
VideoSubtitleGenerator 是非常好用的批量字幕工具!
建议增加 FunASR SenseVoice 作为可选的语音识别引擎。SenseVoice 在中文字幕场景有显著优势:
集成非常简单:
VAD 切分 + 时间戳输出天然适合字幕生成。
参考: