COCO
Emerging50papers using it
2016first seen
The COCO dataset is a large-scale benchmark containing images with corresponding captions, used to evaluate the performance of models in understanding and generating fine-grained visual and textual concepts.
Papers using COCO (50)
- Gaze Heads: How VLMs Look at What They DescribeRF-DETR: Neural Architecture Search For Real-time Detection TransformersVision-Free Retrieval: Rethinking Multimodal Search with Textual Scene DescriptionsPosellm: Enhancing Language-guided Human Pose Estimation With MLP AlignmentHow Well Does Gpt-4o Understand Vision? Evaluating Multimodal Foundation Models On Standard Computer Vision TasksImage-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial InstructionsA novel Framework for Open-Vocabulary Multi-Object Recognition using CLIPQATMA: Quantization-Aware Training with Multimodal Alignment for Open-Vocabulary Object DetectionGood Scores, Bad Data: A Metric for Multimodal CoherenceCognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal ModelsEfficient Vision-Language Reasoning via Adaptive Token PruningRGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World ScenariosA Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance FeedbackAre Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?Semantic-guided Natural Language And Visual Fusion For Cross-modal Interaction Based On Tiny Object DetectionCovmatch: Cross-covariance Guided Multimodal Dataset Distillation With Trainable Text EncoderThe Telephone Game: Evaluating Semantic Drift in Unified ModelsWhen Does Supervised Training Pay Off? The Hidden Economics Of Object Detection In The Era Of Vision-language ModelsGm-skip: Metric-guided Transformer Block Skipping For Efficient Vision-language ModelsRobust Vision-language Models Via Tensor Decomposition: A Defense Against Adversarial AttacksCLASH: A Benchmark For Cross-modal Contradiction DetectionDynamic Context-aware Scene Reasoning Using Vision-language Alignment In Zero-shot Real-world ScenariosCommon Inpainted Objects In-n-out Of ContextLaViDa: A Large Diffusion Language Model for Multimodal UnderstandingCOCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for
Fine-Grained Understanding and GenerationRe-ranking the Context for Multimodal Retrieval Augmented GenerationX-Linear Attention Networks for Image CaptioningProbabilistic Embeddings for Cross-Modal RetrievalUNITER: UNiversal Image-TExt Representation LearningImage as a Foreign Language: BEiT Pretraining for All Vision and
Vision-Language TasksCAMP: Cross-Modal Adaptive Message Passing for Text-Image RetrievalUnderstanding Image and Text Simultaneously: a Dual Vision-Language Machine Comprehension TaskLightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time
Image-Text RetrievalSemantic-Conditional Diffusion Networks for Image CaptioningRevisiting Few-Shot Object Detection with Vision-Language ModelsSecuring Vision-Language Models with a Robust Encoder Against Jailbreak
and Adversarial AttacksMixGen: A New Multi-Modal Data AugmentationVLDeformer: Vision-Language Decomposed Transformer for Fast Cross-Modal RetrievalFine-grained Visual-Text Prompt-Driven Self-Training for Open-Vocabulary
Object DetectionSelf-Supervised Image Captioning with CLIPEfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive PruningSLAN: Self-Locator Aided Network for Cross-Modal UnderstandingCross-Modal Similarity-Based Curriculum Learning for Image CaptioningFine-grained Cross-modal Fusion based Refinement for Text-to-Image
SynthesisMaking the Most of What You Have: Adapting Pre-trained Visual Language
Models in the Low-data RegimeProbVLM: Probabilistic Adapter for Frozen Vision-Language ModelsEnhancing Conceptual Understanding in Multimodal Contrastive Learning
through Hard Negative SamplesObjectCompose: Evaluating Resilience of Vision-Based Models on
Object-to-Background Compositional ChangesMitigating Hallucinations in Large Vision-Language Models (LVLMs) via Language-Contrastive Decoding (LCD)Leveraging Retrieval-Augmented Tags for Large Vision-Language
Understanding in Complex Scenes