MMStar
Emerging10papers using it
2024first seen
MMStar (Are We on the Right Way for Evaluating Large Vision-Language Models?) π Homepage | π€ Dataset | π€ Paper | π arXiv | GitHub Dataset Details As shown in the figure below, existing benchmarks lack consideration of the vision dependency of evaluation samples and potential data leakage from LLMs' and LVLMs' train
Papers using MMStar (10)
- ChatVLA: Unified Multimodal Understanding and Robot Control with
Vision-Language-Action ModelACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric ConstraintsDifference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement LearningHART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop FrameworkQianfan-vl: Domain-enhanced Universal Vision-language ModelsMultimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language ModelsVISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information MaximizationVisual Compositional TuningAre We on the Right Way for Evaluating Large Vision-Language Models?ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs