--- title: Audio-Omni V2A ZeroGPU emoji: "🎛️" colorFrom: indigo colorTo: blue sdk: gradio sdk_version: 5.50.0 app_file: app.py python_version: "3.11" pinned: false --- # Audio-Omni V2A on ZeroGPU This Space runs **Video-to-Audio (V2A)** only, based on [`ZeyueT/Audio-Omni`](https://github.com/ZeyueT/Audio-Omni). ## What it does - Input: video file + optional text prompt - Output: generated audio (`.wav`) - Task used internally: `model.generate("V2A", prompt=..., video_path=...)` ## Environment variables (optional) - `AUDIO_OMNI_REPO_ID` (default: `HKUSTAudio/Audio-Omni`) - `AUDIO_OMNI_CACHE_DIR` (default: `./model`) - `QWEN_OMNI_REPO_ID` (default: `Qwen/Qwen2.5-Omni-3B`) - `QWEN_OMNI_CACHE_DIR` (default: `./model/qwen_omni_3b`) - `GPU_DURATION_SECONDS` (default: `120`) - `MAX_RUNTIME_SECONDS` (default: `115`) - `MAX_STEPS` (default: `85`) - `MAX_AUDIO_SECONDS` (default: `10`) - `MAX_COMPLEXITY` (default: `800`) - `FIXED_SECONDS_TOTAL` (default: `10`, internal generation length for current Audio-Omni constraints) - `OUTPUT_SECONDS` (default: `5`, final exported audio length) - `PREFETCH_ON_START` (default: `1`, run model warmup on page load) - `PREFETCH_ON_BOOT` (default: `1`, pre-download model assets right at container startup) - `FORCE_ZERO_SYNC_FEATURES` (default: `1`, stability workaround for current Audio-Omni bug) - `HF_TOKEN` (optional but recommended for faster/stable Hub downloads) ## Notes - First run can be slow due to model download and initialization. - This demo focuses only on V2A. - Model weights license: CC BY-NC 4.0 (research use).