testovich / README.md
GiorgioV's picture
Update README.md
21b3b7d verified
|
Raw History Blame
1.59 kB
metadata
title: Audio-Omni V2A ZeroGPU
emoji: 🎛️
colorFrom: indigo
colorTo: blue
sdk: gradio
sdk_version: 5.50.0
app_file: app.py
python_version: '3.11'
pinned: false

Audio-Omni V2A on ZeroGPU

This Space runs Video-to-Audio (V2A) only, based on ZeyueT/Audio-Omni.

What it does

  • Input: video file + optional text prompt
  • Output: generated audio (.wav)
  • Task used internally: model.generate("V2A", prompt=..., video_path=...)

Environment variables (optional)

  • AUDIO_OMNI_REPO_ID (default: HKUSTAudio/Audio-Omni)
  • AUDIO_OMNI_CACHE_DIR (default: ./model)
  • QWEN_OMNI_REPO_ID (default: Qwen/Qwen2.5-Omni-3B)
  • QWEN_OMNI_CACHE_DIR (default: ./model/qwen_omni_3b)
  • GPU_DURATION_SECONDS (default: 120)
  • MAX_RUNTIME_SECONDS (default: 115)
  • MAX_STEPS (default: 85)
  • MAX_AUDIO_SECONDS (default: 10)
  • MAX_COMPLEXITY (default: 800)
  • FIXED_SECONDS_TOTAL (default: 10, internal generation length for current Audio-Omni constraints)
  • OUTPUT_SECONDS (default: 5, final exported audio length)
  • PREFETCH_ON_START (default: 1, run model warmup on page load)
  • PREFETCH_ON_BOOT (default: 1, pre-download model assets right at container startup)
  • FORCE_ZERO_SYNC_FEATURES (default: 1, stability workaround for current Audio-Omni bug)
  • HF_TOKEN (optional but recommended for faster/stable Hub downloads)

Notes

  • First run can be slow due to model download and initialization.
  • This demo focuses only on V2A.
  • Model weights license: CC BY-NC 4.0 (research use).