Ziel: Während der User noch spricht, läuft die Transkription bereits chunk-weise; das Overlay zeigt den bisher erkannten Text live an. Beim Loslassen wird der finale Lauf nur noch über den letzten Audio-Schwanz gemacht.
Wert: Subjektiv viel schnelleres Feedback und bessere UX.
Skizze:
AudioRecorder reicht 1–2 s Chunks an einen Streaming-Layer
- faster-whisper unterstützt das nicht nativ — entweder kleinere Modelle für Streaming + großes für Final, oder
whisper_streaming Library evaluieren
- Overlay erweitern: Textbereich für Live-Vorschau (read-only)
- Beim Release Hotkey: finale Transkription + Cleanup; nur wenn Streaming-Ergebnis abweicht ersetzen
- Toggle im Tray, da rechenintensiver
Risiken: Laufzeit/CPU; ggf. nur für "small"-Modell aktivierbar. PoC machen bevor Implementierung.
Akzeptanz: Während Diktat läuft, erscheint Text live im Overlay; Endergebnis ist nicht schlechter als heute.
Ziel: Während der User noch spricht, läuft die Transkription bereits chunk-weise; das Overlay zeigt den bisher erkannten Text live an. Beim Loslassen wird der finale Lauf nur noch über den letzten Audio-Schwanz gemacht.
Wert: Subjektiv viel schnelleres Feedback und bessere UX.
Skizze:
AudioRecorderreicht 1–2 s Chunks an einen Streaming-Layerwhisper_streamingLibrary evaluierenRisiken: Laufzeit/CPU; ggf. nur für "small"-Modell aktivierbar. PoC machen bevor Implementierung.
Akzeptanz: Während Diktat läuft, erscheint Text live im Overlay; Endergebnis ist nicht schlechter als heute.