VSI-Bench
Emerging22papers using it
2025first seen
VSI-Bench is a benchmark that evaluates the performance of Vision-Language Models on eight tasks related to video-based spatial cognition using real-world indoor videos.
Papers using VSI-Bench (22)
- Think3D: Thinking with Space for Spatial ReasoningVision-aligned Latent Reasoning for Multi-modal Large Language ModelEuclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate TasksOmni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview imagesBeyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric ReasoningEgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMsWorld2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial ReasoningThinking with Spatial Code for Physical-World Video ReasoningBoosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene RepresentationsThinking with Geometry: Active Geometry Integration for Spatial ReasoningSpa3R: Predictive Spatial Field Modeling for 3D Visual ReasoningVideo Evidence to Reasoning Efficient Video Understanding via Explicit Evidence GroundingVideo Spatial Reasoning with Object-Centric 3D RolloutSpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language ModelsBeyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal AlignmentVideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial ReasoningScaling Spatial Intelligence With Multimodal Foundation ModelsSee&trek: Training-free Spatial Prompting For Multimodal Large Language ModelVs-bench: Evaluating Vlms For Strategic Abilities In Multi-agent EnvironmentsInternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language ModelsTowards Visuospatial Cognition via Hierarchical Fusion of Visual ExpertsVisuospatial Cognitive Assistant