LLaVA-1.5
Emerging6papers using it
2024first seen
LLaVA-1.5 is a benchmark dataset used to evaluate the performance of vision-language models (VLMs) in understanding and generating responses based on visual and textual inputs.
Papers using LLaVA-1.5 (6)
- Curvature-Guided Mixing for MLLM AdaptationAdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLMPrune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-DiversityConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language ModelsWatch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual ReasoningModel Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large
Language Models