UCF101
Emerging11papers using it
2020first seen
UCF-101 is a benchmark dataset that contains 13,320 videos across 101 action categories, used to evaluate fine-grained video reasoning and action recognition in models.
Papers using UCF101 (11)
- Moclip-lite: Efficient Video Recognition By Fusing CLIP With Motion VectorsThe Professor: Multi-Teacher Unsupervised Prompt Distillation for Vision-Language ModelsPreserving Cross-Modal Consistency for CLIP-based Class-Incremental LearningVideo-STAR: Reinforcing Open-Vocabulary Action Recognition with ToolsReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small ModelsAdvancing Vision-based Human Action Recognition: Exploring Vision-language CLIP Model For Generalisation In Domain-independent TasksSelf-Supervised MultiModal Versatile NetworksBidirectional Cross-Modal Knowledge Exploration for Video Recognition
with Pre-trained Vision-Language ModelsText-Enhanced Zero-Shot Action Recognition: A training-free approachVicTR: Video-conditioned Text Representations for Activity RecognitionMug-STAN: Adapting Image-Language Pretrained Models for General Video
Understanding