本仓库包含:通用音色克隆流程框架 + 展览导览业务试点。
面向「用户提供录音 + 文本 → 微调 → 批量合成」的可配置流程,支持 CosyVoice3 与 GPT-SoVITS 两套后端。
cd voice_clone_pipeline
bash scripts/init_project.sh my_speaker # 交互选择模型
bash scripts/run.sh run --project my_speaker --stages validate,prepare,train,merge
bash scripts/run.sh run --project my_speaker --stages infer --start 1 --end 10示例项目:voice_clone_pipeline/projects/principal(校长音色)、projects/gravity_field(导览推理)。
《命名的时刻》导览稿合成:年龄段适配文稿、切分脚本与批量推理,见 gravity_field/README.md。
训练与推理需另行准备(路径在各自 project.yaml / config/paths.env 中配置):
- CosyVoice 源码与预训练权重
- 微调工作目录与 merged 权重
- 原始训练切片音频(示例项目可指向共享数据目录)