A low-latency Qwen Omni live voice demo with native audio routing, reasoning, and streaming TTS.
-
Updated
Jul 25, 2026 - JavaScript
A low-latency Qwen Omni live voice demo with native audio routing, reasoning, and streaming TTS.
AI music generation, ComfyUI image/video workflows, multimodal chat and sound effects in one portable local AI studio. ACE-Step, MiniMax Music 3, Stable Audio and Qwen Omni, with model management, multi-GPU controls, a media library, CLI and API. A Linux distro; Windows requires WSL2.
Cosight — A realtime multimodal AI agent runtime with composable roles and capabilities.
19 speech engines + Whisper: Kokoro, XTTS v2, F5-TTS, Chatterbox, Fish Speech, Bark, Dia, Higgs Audio, Qwen Omni, VibeVoice, SpeechT5, Parler, OuteTTS, VITS, Edge, Voxtral, VoxCPM2, CSM and Orpheus. Voice cloning, SRT, audio editor, CLI/API. Offline Kokoro included. From portable-linux-in-a-box.
Voice-interactive EDM recognition & subgenre classification - Qwen2.5-Omni QLoRA / FMA?Beatport pipeline
Omni-modal Preference Extraction and Ranking Architecture
To associate your repository with the qwen-omni topic, visit your repo's landing page and select "manage topics."