VATEX
Emerging6papers using it
2021first seen
VATEX is a large-scale multilingual video description dataset, which contains over 41,250 videos and 825,000 captions in both English and Chinese. VATEX is characterized by the following major unique properties. First, it contains both English and Chinese descriptions at scale, which can support many multilingual studi
Papers using VATEX (6)
- ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video CaptioningGAIS: Frame-level Gated Audio-visual Integration With Semantic Variance-scaled Perturbation For Text-video RetrievalCLIP2Video: Mastering Video-Text Retrieval via Image CLIPAccommodating Audio Modality in CLIP for Multimodal ProcessingMultilingual Multimodal Pre-training for Zero-Shot Cross-Lingual
Transfer of Vision-Language ModelsCL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual
Knowledge Transfer