ReVoice — автономная десктоп-студия клонирования голоса, синтеза речи и создания аудиокниг. Всё работает локально на вашем компьютере: никаких подписок, облаков и утечек данных.
- Zero-Shot клонирование голоса: достаточно одной чистой записи диктора длиной 5–15 секунд с дословным текстом.
- Поддержка нейросетевых движков нового поколения:
- Qwen3-TTS (0.6B / 1.7B) — ультрабыстрый синтез с превосходной интонацией (24 кГц).
- Fish Speech 1.5 — студийное качество с автоопределением языка и высокой детализацией (44.1 кГц).
- Студия аудиокниг (M4B):
- Автоматическая разбивка текста на главы.
- Умная авторазметка эмоциональных пауз, многоточий и акцентов.
- Сборка полноценного аудиофайла
.m4bс оглавлением для Apple Books, Smart AudioBook Player и других.
- Умный контроль качества эталонов (QA Validator): автоматическая отбраковка шума, тишины, клиппинга и некачественных записей до запуска инференса.
- Бережное отношение к видеопамяти: автоматическая выгрузка неиспользуемых моделей, гарантирующая стабильную работу в рамках бюджета 4 ГБ VRAM.
- Глобальный хоткей
Ctrl+Shift+V— синтез выделенного текста прямо из буфера обмена.
- Скачайте инсталлятор
ReVoice_0.1.0_x64_ru-RU.msiсо страницы Releases. - Запустите установку двойным кликом (установка происходит в один клик без дополнительных сервисов).
- Запустите ReVoice из меню «Пуск» или с рабочего стола.
- Перейдите во вкладку «Модели».
- В строке Qwen3-TTS 0.6B нажмите кнопку «Скачать» (загрузится базовая модель ~1.2 ГБ). Если веса уже были скачаны ранее через HuggingFace, просто нажмите «Указать путь» и выберите папку.
- Откройте вкладку «Голоса» и нажмите «+».
- Укажите имя голоса (например, «Иван») и перетащите аудиофайл (чистая запись речи 5–15 секунд).
- Введите точный текст того, что сказано в аудиозаписи, и сохраните. Система проверит качество и покажет статус «Годен к синтезу».
- Перейдите во вкладку «Синтез», введите любую фразу и нажмите «Синтезировать голос».
- Откройте вкладку «Книги».
- Вставьте текст главы или нажмите «Загрузить TXT / MD».
- Нажмите «Расставить паузы и интонации» для естественного дыхания и выразительности.
- Нажмите «Озвучить главу и собрать M4B». Готовый файл аудиокниги появится в вашей папке генераций с готовым оглавлением!
Important
Ограничения оборудования и моделей:
- Видеопамять (VRAM):
- Приложение оптимизировано под GPU с объёмом от 4 ГБ VRAM (GeForce GTX 1650 Ti / RTX 3050 и выше).
- Рекомендуется использовать модель Qwen3-TTS 0.6B для систем с 4 ГБ VRAM.
- Модели 1.7B и Fish Speech 1.5 требуют до 3.8–4.0 ГБ VRAM, поэтому перед их загрузкой все остальные модели автоматически выгружаются.
- Отсутствие предустановленных весов:
- В дистрибутив и репозиторий намеренно не включены файлы весов нейросетей, чтобы установщик оставался легковесным (~7 МБ). Все веса загружаются пользователем через экран «Модели» либо подключаются локально.
- CUDA-ускорение:
- Аппаратное ускорение на данный момент протестировано для архитектуры Windows x64 с поддержкой NVIDIA CUDA. При отсутствии совместимого GPU приложение переходит в процессорный режим (CPU), при котором скорость генерации будет ниже.
ReVoice/
├── app/ # Десктопный фронтенд: React 18, TypeScript, Tailwind CSS, Vite
├── src-tauri/ # Нативная оболочка Tauri 2 (Rust): системный трей, хоткеи, сборщик MSI
├── backend/ # Высокопроизводительный Python-бэкенд на FastAPI:
│ ├── revoice/
│ │ ├── backends/ # Движки синтеза: Qwen3-TTS, Fish Speech 1.5
│ │ ├── routes/ # API-маршруты: health, models, profiles, synthesize, book, effects
│ │ ├── services/ # QA-валидатор, менеджер моделей, чанкер, сборщик M4B (ffmpeg)
│ │ └── database/ # Локальная база данных SQLite (%APPDATA%/Revoice/revoice.db)
│ └── tests/ # Набор модульных и статических тестов
- Node.js 20+ и npm
- Rust 1.75+ и Cargo
- Python 3.10–3.12 и менеджер пакетов uv
cd backend
uv run pytest -vcd app
npm.cmd install
npm.cmd run devnpm.cmd --prefix app run build
app\node_modules\.bin\tauri.cmd build -b msi --ignore-version-mismatchesРаспространяется под свободной лицензией MIT. Подробнее см. в файле LICENSE. Веса нейросетевых моделей Qwen и Fish Speech распространяются под их собственными лицензиями (Apache-2.0 и CC-BY-NC-SA-4.0 соответственно).