Conceptual Captions
Canonical16papers using it
14,857HF downloads
109HF likes
2019first seen
Dataset Card for Conceptual Captions Dataset Summary Conceptual Captions is a dataset consisting of ~3.3M images annotated with captions. In contrast with the curated style of other image caption annotations, Conceptual Caption images and their raw descriptions are harvested from the web, and therefore represent a wide
π€ Hugging Faceβ other
Papers using Conceptual Captions (16)
- Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer DistillationDINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking ConsistencyDREAM: Where Visual Understanding Meets Text-to-Image GenerationBeyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language ModelsAre Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?ViLU: Learning Vision-Language Uncertainties for Failure PredictionRedemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal TriangulationViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for
Vision-and-Language TasksVL-BERT: Pre-training of Generic Visual-Linguistic RepresentationsUNITER: UNiversal Image-TExt Representation LearningImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised
Image-Text DataConceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize
Long-Tail Visual ConceptsLarge-scale Pretraining for Visual Dialog: A Simple State-of-the-Art
BaselineImproving Vision-and-Language Navigation with Image-Text Pairs from the
WebL-Verse: Bidirectional Generation Between Image and TextUnified Lexical Representation for Interpretable Visual-Language
Alignment