video-SALMONN 2

tsinghua-ee 's Collections

updated Mar 21

video-SALMONN 2 is a powerful audio-visual large language model (LLM) that generates high-quality audio-visual video captions.