Skip to content

Streaming-STT mit Live-Preview im Overlay #26

Description

@RTF22

Ziel: Während der User noch spricht, läuft die Transkription bereits chunk-weise; das Overlay zeigt den bisher erkannten Text live an. Beim Loslassen wird der finale Lauf nur noch über den letzten Audio-Schwanz gemacht.

Wert: Subjektiv viel schnelleres Feedback und bessere UX.

Skizze:

  • AudioRecorder reicht 1–2 s Chunks an einen Streaming-Layer
  • faster-whisper unterstützt das nicht nativ — entweder kleinere Modelle für Streaming + großes für Final, oder whisper_streaming Library evaluieren
  • Overlay erweitern: Textbereich für Live-Vorschau (read-only)
  • Beim Release Hotkey: finale Transkription + Cleanup; nur wenn Streaming-Ergebnis abweicht ersetzen
  • Toggle im Tray, da rechenintensiver

Risiken: Laufzeit/CPU; ggf. nur für "small"-Modell aktivierbar. PoC machen bevor Implementierung.

Akzeptanz: Während Diktat läuft, erscheint Text live im Overlay; Endergebnis ist nicht schlechter als heute.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions