POPE
Canonical47papers using it
2024first seen
Large-scale Multi-modality Models Evaluation Suite Accelerating the development of large-scale multi-modality models (LMMs) with lmms-eval π Homepage | π Documentation | π€ Huggingface Datasets This Dataset This is a formatted version of POPE. It is used in our lmms-eval pipeline to allow for one-click evaluations of
Papers using POPE (47)
- SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and PlanningSeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token EngineeringThe Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model LineagesMitigating Hallucinations in Large Vision-Language Models with Internal
Fact-based Contrastive DecodingGEASS: Gated Evidence-Adaptive Selective Caption Trust for Vision-Language ModelsWhen Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language ModelsAre Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM ReasoningMitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention RecalibrationSee Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language AlignmentMultilingual Training and Evaluation Resources for Vision-Language ModelsGlobal Context or Local Detail? Adaptive Visual Grounding for Hallucination MitigationInstruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language ReasoningAnatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language ModelsKestrel: Grounding Self-Refinement for LVLM Hallucination MitigationMitigating Object Hallucinations in LVLMs via Attention Imbalance RectificationSame Answer, Different Representations: Hidden instability in VLMsSchr\"oMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schr\"odinger Bridge ProblemNoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language PriorsBeyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language ModelsHulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language ModelsSAVE: Sparse Autoencoder-driven Visual Information Enhancement For Mitigating Object HallucinationVision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal SteeringAttention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMsConscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language ModelsHybridToken-VLM: Hybrid Token Compression for Vision-Language ModelsCausally-Grounded Dual-Path Attention Intervention for Object Hallucination Mitigation in LVLMsGrounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual ConsistencyMaskCD: Mitigating LVLM Hallucinations by Image Head Masked Contrastive DecodingWatermarking for Factuality: Guiding Vision-Language Models Toward Truth via Tri-layer Contrastive DecodingToken-Level Inference-Time Alignment for Vision-Language ModelsFusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language ModelAttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention AnchorsORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language ModelsEnergy-Guided Decoding for Object Hallucination MitigationByDeWay: Boost Your multimodal LLM with DEpth prompting in a Training-Free WayASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLMConstructive Distortion: Improving Mllms With Attention-guided Image WarpingToward More Reliable Artificial Intelligence: Reducing Hallucinations In Vision-language ModelsSmoothguard: Defending Multimodal Large Language Models With Noise Perturbation And Clustering AggregationBIMA: Bijective Maximum Likelihood Learning Approach To Hallucination Prediction And Mitigation In Large Vision-language ModelsPostAlign: Multimodal Grounding as a Corrective Lens for MLLMsMitigating Hallucination in Large Vision-Language Models via Adaptive Attention CalibrationInstruction-Aligned Visual Attention for Mitigating Hallucinations in
Large Vision-Language ModelsCutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge BasePensieve: Retrospect-then-Compare Mitigates Visual HallucinationExploring Multi-Grained Concept Annotations for Multimodal Large
Language ModelsHallucination Elimination and Semantic Enhancement Framework for
Vision-Language Models in Traffic Scenarios