MME
Canonical33papers using it
2023first seen
The 'MME' dataset/benchmark is used to evaluate the performance of Multi-modal Large Language Models (MLLMs) in mitigating visual hallucination by comparing their generated responses against accurate visual cues from provided images.
Papers using MME (33)
- SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token EngineeringMitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive DecodingMake Your LVLM KV Cache More LightweightMitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention RecalibrationHierarchical Pre-Training of Vision Encoders with Large Language ModelsMultilingual Training and Evaluation Resources for Vision-Language ModelsGlobal Context or Local Detail? Adaptive Visual Grounding for Hallucination MitigationInstruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language ReasoningAnatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language ModelsSchr\"oMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schr\"odinger Bridge ProblemBeyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language ModelsHulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language ModelsHybridToken-VLM: Hybrid Token Compression for Vision-Language ModelsGrounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual ConsistencyMaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive DecodingWatermarking for Factuality: Guiding Vision-Language Models Toward Truth via Tri-layer Contrastive DecodingFusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language ModelThe Telephone Game: Evaluating Semantic Drift in Unified ModelsEnergy-Guided Decoding for Object Hallucination MitigationFast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question AnsweringPostAlign: Multimodal Grounding as a Corrective Lens for MLLMsVISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information MaximizationTARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative ConnectionInstruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language ModelsInternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and CompositionMMICL: Empowering Vision-language Model with Multi-Modal In-Context LearningBLIVA: A Simple Multimodal LLM for Better Handling of Text-Rich Visual QuestionsFine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative InstructionsSilkie: Preference Distillation for Large Visual Language ModelsPensieve: Retrospect-then-Compare Mitigates Visual HallucinationParGo: Bridging Vision-Language with Partial and Global ViewsDynamic Multimodal Evaluation with Flexible Complexity by Vision-Language BootstrappingEnhancing Instruction-Following Capability of Visual-Language Models by
Reducing Image Redundancy