ActivityNet Caption
Emerging15papers using it
2019first seen
Papers using ActivityNet Caption (15)
- PEEK: Picking Essential frames via Efficient Knowledge distillationChrono: A Simple Blueprint for Representing Time in MLLMsSAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video CaptioningStay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video CaptioningSee More, Store Less: Memory-Efficient Resolution for Video Moment RetrievalExplicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal InteractionVideoComp: Advancing Fine-Grained Compositional and Temporal Alignment
in Video-Text ModelsWeakly Supervised Temporal Adjacent Network for Language GroundingEnd-to-end Multi-modal Video Temporal GroundingFine-grained Iterative Attention Network for TemporalLanguage
Localization in VideosLearning Modality Interaction for Temporal Sentence Localization and
Event Captioning in VideosLearning Grounded Vision-Language Representation for Versatile
Understanding in Untrimmed VideosRelation-aware Video Reading Comprehension for Temporal Language
GroundingReducing the Vision and Language Bias for Temporal Sentence GroundingWatch, Listen and Tell: Multi-modal Weakly Supervised Dense Event
Captioning