MSR-VTT
Canonical28papers using it
2020first seen
Dataset Card for "msr-vtt" More Information needed
Papers using MSR-VTT (28)
- PEEK: Picking Essential frames via Efficient Knowledge distillationInstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal UnderstandingBima: Towards Biases Mitigation For Text-video Retrieval Via Scene Element GuidanceOmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher DistillationABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video CaptioningDelving Deeper: Hierarchical Visual Perception for Robust Video-Text RetrievalFrom Captions To Keyframes: Keyscore For Multimodal Frame Scoring And Video-language UnderstandingGAIS: Frame-level Gated Audio-visual Integration With Semantic Variance-scaled Perturbation For Text-video RetrievalCLIP2Video: Mastering Video-Text Retrieval via Image CLIPCLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language
Representation AlignmentmPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image
and VideoUniAdapter: Unified Parameter-Efficient Transfer Learning for
Cross-modal ModelingCross-Modal Adapter for Vision-Language RetrievalTencent Text-Video Retrieval: Hierarchical Cross-Modal Interactions with
Multi-Level RepresentationsStacked Convolutional Deep Encoding Network for Video-Text RetrievalLearning Modality Interaction for Temporal Sentence Localization and
Event Captioning in VideosX-Pool: Cross-Modal Language-Video Attention for Text-Video RetrievalAccommodating Audio Modality in CLIP for Multimodal ProcessingDistilling Vision-Language Models on Millions of VideosTACo: Token-aware Cascade Contrastive Learning for Video-Text AlignmentSupport-set based Multi-modal Representation Enhancement for Video
CaptioningRevisiting Temporal Modeling for CLIP-based Image-to-Video Knowledge
TransferringVideo-Teller: Enhancing Cross-Modal Generation with Fusion and
DecouplingMuMUR : Multilingual Multimodal Universal RetrievalTagging before Alignment: Integrating Multi-Modal Tags for Video-Text
RetrievalLinear Alignment of Vision-language Models for Image CaptioningMug-STAN: Adapting Image-Language Pretrained Models for General Video
UnderstandingE-ViLM: Efficient Video-Language Model via Masked Video Modeling with
Semantic Vector-Quantized Tokenizer