RefCOCO
Canonical33papers using it
2021first seen
Dataset Card for "refcoco" More Information needed
Papers using RefCOCO (33)
- Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression TasksLENS: Learning To Segment Anything With Unified Reinforced ReasoningDiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language ModelStateVLM: A State-Aware Vision-Language Model for Robotic Affordance ReasoningMoondream Segmentation: From Words to MasksCoME-VL: Scaling Complementary Multi-Encoder Vision-Language LearningCoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream TasksPerceptio: Perception Enhanced Vision Language Models via Spatial Token GenerationDetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object DetectionChain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehensionGenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring SegmentationEGM: Efficient Visual Grounding Language ModelsCoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language TasksRSAgent: Learning to Reason and Act for Text-Guided Segmentation via Multi-Turn Tool InvocationsConnecting the Dots: Training-Free Visual Grounding via Agentic ReasoningLavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and GenerationBlind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial UnderstandingAlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual GroundingHierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust GroundingGrounding-aware Token Pruning: Recovering From Drastic Performance Drops In Visual Grounding Caused By PruningZero-shot Referring Expression Comprehension Via Vison-language True/false VerificationCoprs: Learning Positional Prior From Chain-of-thought For Reasoning SegmentationCPT: Colorful Prompt Tuning for Pre-trained Vision-Language ModelsONE-PEACE: Exploring One General Representation Model Toward Unlimited
ModalitiesMaIL: A Unified Mask-Image-Language Trimodal Network for Referring Image
SegmentationMixGen: A New Multi-Modal Data AugmentationVisual Question Answering based on Local-Scene-Aware Referring
Expression GenerationUnsupervised Vision-and-Language Pre-training via Retrieval-based
Multi-Granular AlignmentSelf-paced Multi-grained Cross-modal Interaction Modeling for Referring
Expression ComprehensionImproving Visual Grounding by Encouraging Consistent Gradient-based
ExplanationsVITR: Augmenting Vision Transformers with Relation-Focused Learning for
Cross-Modal Information RetrievalFuse & Calibrate: A bi-directional Vision-Language Guided Framework for
Referring Image SegmentationTowards Language-guided Visual Recognition via Dynamic Convolutions