VideoMME
Emerging5papers using it
2025first seen
The 'VideoMME' dataset/benchmark contains video clips paired with questions and is used to evaluate models' abilities in spatio-temporal grounding and reasoning across frames in video understanding tasks.
Papers using VideoMME (5)
- Scaling RL to Long VideosChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video UnderstandingVisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception PromptingFrameMind: Frame-Interleaved Video Reasoning via Reinforcement LearningViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning