testovich / README.md
GiorgioV's picture
Update README.md
21b3b7d verified
|
Raw History Blame
1.59 kB
---
title: Audio-Omni V2A ZeroGPU
emoji: "🎛️"
colorFrom: indigo
colorTo: blue
sdk: gradio
sdk_version: 5.50.0
app_file: app.py
python_version: "3.11"
pinned: false
---
# Audio-Omni V2A on ZeroGPU
This Space runs **Video-to-Audio (V2A)** only, based on
[`ZeyueT/Audio-Omni`](https://github.com/ZeyueT/Audio-Omni).
## What it does
- Input: video file + optional text prompt
- Output: generated audio (`.wav`)
- Task used internally: `model.generate("V2A", prompt=..., video_path=...)`
## Environment variables (optional)
- `AUDIO_OMNI_REPO_ID` (default: `HKUSTAudio/Audio-Omni`)
- `AUDIO_OMNI_CACHE_DIR` (default: `./model`)
- `QWEN_OMNI_REPO_ID` (default: `Qwen/Qwen2.5-Omni-3B`)
- `QWEN_OMNI_CACHE_DIR` (default: `./model/qwen_omni_3b`)
- `GPU_DURATION_SECONDS` (default: `120`)
- `MAX_RUNTIME_SECONDS` (default: `115`)
- `MAX_STEPS` (default: `85`)
- `MAX_AUDIO_SECONDS` (default: `10`)
- `MAX_COMPLEXITY` (default: `800`)
- `FIXED_SECONDS_TOTAL` (default: `10`, internal generation length for current Audio-Omni constraints)
- `OUTPUT_SECONDS` (default: `5`, final exported audio length)
- `PREFETCH_ON_START` (default: `1`, run model warmup on page load)
- `PREFETCH_ON_BOOT` (default: `1`, pre-download model assets right at container startup)
- `FORCE_ZERO_SYNC_FEATURES` (default: `1`, stability workaround for current Audio-Omni bug)
- `HF_TOKEN` (optional but recommended for faster/stable Hub downloads)
## Notes
- First run can be slow due to model download and initialization.
- This demo focuses only on V2A.
- Model weights license: CC BY-NC 4.0 (research use).