RTT(Real-Time Translator) 是一款面向 Web/PWA、Android 和 Windows 的实时翻译平台。它把外语影片、直播、会议、语音聊天,或视频画面中已有的字幕,转换成可以悬浮显示的原文和目标语言译文,也支持文字与字幕文件翻译。
产品首页 · Web 工作台 · 中文镜像 · 模型目录 · 下载最新版本 · 中文使用指南 · English guide
两个域名的根路径是产品首页,首页可直接注册、登录或进入 Web 工作台;/app/ 是受账户门禁保护的翻译工作台。浏览器支持实时语音、主动共享画面后的字幕区域 OCR、文字与文件翻译、能力档案、模型目录和 PWA 安装。GitHub Pages 地址保留作为备用镜像。
- 看外语电影、视频和直播:捕获允许录制的应用音频,实时显示原文与简体中文字幕。
- 听外语会议或语音聊天:通过麦克风识别扬声器播放的远端声音,适合外放场景。
- 翻译画面中的原文字幕:在 Android 上框选字幕区域,设备端 OCR 稳定识别后再翻译。
- 处理一段文字或字幕文件:在“翻译机”中输入文本,或把
.txt、.md、.srt、.vtt放入本地翻译队列。
RTT 不播放或修改视频,不编辑字幕文件,也不会把延迟式中文播报宣传为口型同步配音。
- 从 Releases 下载对应平台的安装包,并核对同版本的
SHA256SUMS.txt。 - 在 RTT 的“模型”中保留内置模型,或按源语言下载、导入并选择自己的本地模型;也可以分别配置语音识别和文字翻译 API。
- 在“字幕”中选择 语音、画面字幕 或 同时启用,授予需要的权限后点击“开始”。画面字幕模式会先让你框选字幕区域。
Android 翻译会话运行在前台服务中。回到桌面、打开播放器后仍会继续,且会显示常驻通知;点击通知中的停止操作或悬浮字幕右上角关闭按钮即可结束会话。系统重启、屏幕捕获授权被撤销或某些厂商强制清理后台后,需要重新启动并授权。
Web、Android 和 Windows 都会先显示登录或注册界面,并统一使用 Supabase 在线账户;没有有效会话时不能进入工作台,不再提供离线账户。支持邮箱注册、强制邮箱验证、邮箱密码登录、GitHub OAuth、会话恢复、显示名称跨端同步和密码重置。Android 与 Windows 的“忘记密码”会打开同一套 Web 恢复流程。API Key 会保留设备加密副本,并以 AES-256-GCM 密文同步到账户;Android 断网保存或删除的操作会排队,在恢复登录和网络后补同步。模型文件、模型路径、音频、字幕和译文正文仍只保存在本机。在线账户部署、RLS 和双域名回调配置见 在线账户部署。
| 需求 | 推荐选择 | 说明 |
|---|---|---|
| 优先速度 | Vosk 小模型 | 适合英语、日语等已选定源语言;资源占用低。 |
| 多语种本地识别 | SenseVoiceSmall INT8 | 默认准确模式,适合英语、中文、日语、韩语、粤语等。 |
| 尽量多的语言 | Omnilingual CTC 300M INT8 | 面向广语言覆盖;没有标点模型时 RTT 使用 VAD 与语言规则分句。 |
| 更高准确率 | Qwen3-ASR 0.6B INT8 | 约 879 MB,适合大内存 Android 设备和 Windows。 |
| 不想上传内容 | 本地 ASR + 本地翻译 | 下载完成后可断网使用,不会隐式请求云端。 |
| 想要更好的译文 | 本地 ASR + 翻译 API | 文字翻译可选择 DeepL、百度翻译、LibreTranslate 或兼容 API 平台。 |
语音识别、文字翻译、分句与标点、OCR、TTS 在 RTT 中是独立能力。比如可以使用“本地 SenseVoice + DeepL 翻译”,或“阿里云实时语音识别 + 本地翻译”。能力档案支持多个命名配置,避免一个 API Key 被错误用于另一个模型或接口。
Omnilingual CTC 300M INT8:若你看到
OmnilingualRecognizerFactory cannot be cast to AccurateRecognizerFactory,这是旧构建的启动代码问题,不是模型文件损坏。更新到最新 RTT 构建后无需重新下载模型。
- 应用内下载:保留 Vosk 和其他语言模型的下载入口,可按语言筛选并自行选择已安装模型。
- Android 本地模型限制:单个可下载模型包上限为 1 GB;基础模型随 APK 提供,其余模型由用户主动下载。
- 本地文字翻译:支持 ML Kit 语言包和经过 Marian ONNX 布局验证的导入模型。导入模型可以添加自己的说明;尚未验证的目录会显示为参考资料,不会假装可以运行。
- 翻译 API:除了通用模型 API,单独提供 DeepL、百度翻译与 LibreTranslate 的翻译配置页。
推荐模型、下载来源、许可证、平台建议和验证状态见 推荐模型与许可证。候选模型不会被标记为“可用”,直到其运行时、许可证、文件校验与设备推理均通过验证。
应用音频 / 麦克风 屏幕字幕区域
│ │
▼ ▼
16 kHz 单声道 PCM → VAD / ASR OCR → 稳定帧去重
│ │
└──────────────┬─────────────────┘
▼
分句、标点、稳定前缀与上下文
▼
本地或云端文字翻译
▼
双语悬浮字幕 / 全文记录 / 可选中文播报
为了减少“字幕半句就翻”和“已经显示的句子被改写”,RTT 将 VAD、最终识别结果、标点和语言规则一起用于分句;稳定前缀保持不动,只刷新仍可能变化的尾部。翻译会保留最近少量上下文,旧请求的晚到结果不能覆盖新修订。
- 设备内部音频或麦克风输入
- 双语悬浮字幕,可拖动、手动缩放、调整宽度与透明度
- 语音、画面字幕或两者同时翻译
- 设备端 ML Kit OCR 与字幕区域框选
- 模型下载、导入、校验和删除
- “全文”记录与“翻译机”文字/文件翻译队列
Android 的受保护通话音频不能直接内录。用于语音聊天时,请使用扬声器播放远端声音,并让麦克风收音;耳机中的远端声音通常不会进入麦克风。
- WASAPI 默认输出设备回环捕获
- 透明置顶字幕窗和系统托盘控制
- 本地模型和云端能力档案
- 默认设备切换后可恢复会话
Windows 首版以默认输出设备捕获为主要路径。插拔耳机、切换默认输出设备或从睡眠恢复后,如音量表不再变化,请重新启动当前翻译会话。
RTT 不收集遥测。诊断日志默认关闭,且不得写入音频、字幕正文或 API Key。Android 使用 Keystore,Windows 使用 DPAPI/Credential Locker 保存设备副本;云端只保存 AES-256-GCM 密文、指纹与同步元数据。只有用户主动显示或复制,或开发者管理员在近期重新认证、填写原因并留下审计记录后,才会临时解密指定密钥。
- 本地模式不会上传音频、画面或字幕正文。
- 使用云端功能时,RTT 会明确显示实际使用的能力、模型和服务商。
- DRM 内容、禁止
AudioPlaybackCapture的应用以及FLAG_SECURE画面无法绕过。 - “压低原声”不可用时,中文播报会自动退化为叠加播放。
RTT 使用 Apache-2.0 许可证。模型与第三方组件保留各自的许可证,详见 第三方声明。
开发、构建和贡献说明在 CONTRIBUTING.md;完整技术文档与模型清单在 docs/ 和 models/ 目录中。
