MMEB
Emerging12papers using it
2024first seen
MMEB (Massive Multimodal Embedding Benchmark) is a comprehensive benchmark that includes 4 meta-tasks and 36 datasets designed to evaluate universal multimodal embedding models across various downstream tasks.
Papers using MMEB (12)
- LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive LearningCombating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal RetrievalAdaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative AmplificationCREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and ComprehensionCompressing then Matching: An Efficient Pre-training Paradigm for Multimodal EmbeddingFreeRet: MLLMs as Training-Free RetrieversVLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual DocumentsImprove Multi-Modal Embedding Learning via Explicit Hard Negative Gradient AmplifyingMoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal EmbeddingsBreaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMsmmE5: Improving Multimodal Multilingual Embeddings via High-quality
Synthetic DataVLM2Vec: Training Vision-Language Models for Massive Multimodal
Embedding Tasks