Skip to content

Latest commit

 

History

31 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

ReVoice 🎙️

ReVoice — автономная десктоп-студия клонирования голоса, синтеза речи и создания аудиокниг. Всё работает локально на вашем компьютере: никаких подписок, облаков и утечек данных.

Release License: MIT Platform: Windows


Возможности

  • Zero-Shot клонирование голоса: достаточно одной чистой записи диктора длиной 5–15 секунд с дословным текстом.
  • Поддержка нейросетевых движков нового поколения:
    • Qwen3-TTS (0.6B / 1.7B) — ультрабыстрый синтез с превосходной интонацией (24 кГц).
    • Fish Speech 1.5 — студийное качество с автоопределением языка и высокой детализацией (44.1 кГц).
  • Студия аудиокниг (M4B):
    • Автоматическая разбивка текста на главы.
    • Умная авторазметка эмоциональных пауз, многоточий и акцентов.
    • Сборка полноценного аудиофайла .m4b с оглавлением для Apple Books, Smart AudioBook Player и других.
  • Умный контроль качества эталонов (QA Validator): автоматическая отбраковка шума, тишины, клиппинга и некачественных записей до запуска инференса.
  • Бережное отношение к видеопамяти: автоматическая выгрузка неиспользуемых моделей, гарантирующая стабильную работу в рамках бюджета 4 ГБ VRAM.
  • Глобальный хоткей Ctrl+Shift+V — синтез выделенного текста прямо из буфера обмена.

Быстрый старт (Путь новичка за 3 шага)

1. Установка

  1. Скачайте инсталлятор ReVoice_0.1.0_x64_ru-RU.msi со страницы Releases.
  2. Запустите установку двойным кликом (установка происходит в один клик без дополнительных сервисов).
  3. Запустите ReVoice из меню «Пуск» или с рабочего стола.

2. Подключение модели

  1. Перейдите во вкладку «Модели».
  2. В строке Qwen3-TTS 0.6B нажмите кнопку «Скачать» (загрузится базовая модель ~1.2 ГБ). Если веса уже были скачаны ранее через HuggingFace, просто нажмите «Указать путь» и выберите папку.

3. Создание голоса и первый синтез

  1. Откройте вкладку «Голоса» и нажмите «+».
  2. Укажите имя голоса (например, «Иван») и перетащите аудиофайл (чистая запись речи 5–15 секунд).
  3. Введите точный текст того, что сказано в аудиозаписи, и сохраните. Система проверит качество и покажет статус «Годен к синтезу».
  4. Перейдите во вкладку «Синтез», введите любую фразу и нажмите «Синтезировать голос».

4. Озвучка книги в M4B

  1. Откройте вкладку «Книги».
  2. Вставьте текст главы или нажмите «Загрузить TXT / MD».
  3. Нажмите «Расставить паузы и интонации» для естественного дыхания и выразительности.
  4. Нажмите «Озвучить главу и собрать M4B». Готовый файл аудиокниги появится в вашей папке генераций с готовым оглавлением!

Системные требования и ограничения

Important

Ограничения оборудования и моделей:

  1. Видеопамять (VRAM):
    • Приложение оптимизировано под GPU с объёмом от 4 ГБ VRAM (GeForce GTX 1650 Ti / RTX 3050 и выше).
    • Рекомендуется использовать модель Qwen3-TTS 0.6B для систем с 4 ГБ VRAM.
    • Модели 1.7B и Fish Speech 1.5 требуют до 3.8–4.0 ГБ VRAM, поэтому перед их загрузкой все остальные модели автоматически выгружаются.
  2. Отсутствие предустановленных весов:
    • В дистрибутив и репозиторий намеренно не включены файлы весов нейросетей, чтобы установщик оставался легковесным (~7 МБ). Все веса загружаются пользователем через экран «Модели» либо подключаются локально.
  3. CUDA-ускорение:
    • Аппаратное ускорение на данный момент протестировано для архитектуры Windows x64 с поддержкой NVIDIA CUDA. При отсутствии совместимого GPU приложение переходит в процессорный режим (CPU), при котором скорость генерации будет ниже.

Архитектура проекта

ReVoice/
├── app/                  # Десктопный фронтенд: React 18, TypeScript, Tailwind CSS, Vite
├── src-tauri/            # Нативная оболочка Tauri 2 (Rust): системный трей, хоткеи, сборщик MSI
├── backend/              # Высокопроизводительный Python-бэкенд на FastAPI:
│   ├── revoice/
│   │   ├── backends/     # Движки синтеза: Qwen3-TTS, Fish Speech 1.5
│   │   ├── routes/       # API-маршруты: health, models, profiles, synthesize, book, effects
│   │   ├── services/     # QA-валидатор, менеджер моделей, чанкер, сборщик M4B (ffmpeg)
│   │   └── database/     # Локальная база данных SQLite (%APPDATA%/Revoice/revoice.db)
│   └── tests/            # Набор модульных и статических тестов

Разработка и сборка из исходников

Требования

  • Node.js 20+ и npm
  • Rust 1.75+ и Cargo
  • Python 3.10–3.12 и менеджер пакетов uv

Запуск тестов бэкенда

cd backend
uv run pytest -v

Запуск фронтенда

cd app
npm.cmd install
npm.cmd run dev

Сборка MSI установщика

npm.cmd --prefix app run build
app\node_modules\.bin\tauri.cmd build -b msi --ignore-version-mismatches

Лицензия

Распространяется под свободной лицензией MIT. Подробнее см. в файле LICENSE. Веса нейросетевых моделей Qwen и Fish Speech распространяются под их собственными лицензиями (Apache-2.0 и CC-BY-NC-SA-4.0 соответственно).

About

ReVoice — free, local-first voice cloning & audiobook studio: Qwen3-TTS cloning, chapter narration, M4B export. No cloud, runs on 4GB VRAM.

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages