Flickr30k
Canonical54papers using it
2018first seen
""" _HOMEPAGE = "https://shannon.cs.illinois.edu/DenotationGraph/" # TODO: Victor _LICENSE = "" _ANNOTATION_URL = "http://cs.stanford.edu/people/karpathy/deepimagesent/caption_datasets.zip" _FEATURES = datasets.Features( { "image": datasets.Image(), "filename": datasets.Value("string"), "imgid": datasets.Value("int32")
Papers using Flickr30k (53)
- Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal ReasoningCODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text RetrievalCIBR: Cross-modal Information Bottleneck Regularization for Robust CLIP
GeneralizationVision-Free Retrieval: Rethinking Multimodal Search with Textual Scene DescriptionsDistill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer DistillationMM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail DataLogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual VerificationCoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language TasksParameter Efficient Multimodal Instruction Tuning for Romanian Vision Language ModelsSEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignmentCross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain ModelingA Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance FeedbackExtracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable KnowledgeRate-distortion Limits For Multimodal Retrieval: Theory, Optimal Codes, And Finite-sample GuaranteesRobust Vision-language Models Via Tensor Decomposition: A Defense Against Adversarial AttacksCompositional Image-Text Matching and Retrieval by Grounding EntitiesBeyond Modality Collapse: Representations Blending for Multimodal Dataset DistillationVisualBERT: A Simple and Performant Baseline for Vision and LanguageVisual Entailment: A Novel Task for Fine-Grained Image UnderstandingImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised
Image-Text DataImage as a Foreign Language: BEiT Pretraining for All Vision and
Vision-Language TasksONE-PEACE: Exploring One General Representation Model Toward Unlimited
ModalitiesLearning Visual Relation Priors for Image-Text Matching and Image
Captioning with Neural Scene Graph GeneratorsCAMP: Cross-Modal Adaptive Message Passing for Text-Image RetrievalCross-Modal Adapter for Vision-Language RetrievalSaliency-Guided Attention Network for Image-Sentence MatchingVisual Entailment Task for Visually-Grounded Language LearningA Frustratingly Simple Approach for End-to-End Image CaptioningCross-modal Scene Graph Matching for Relationship-aware Image-Text
RetrievalStacked Cross-modal Feature Consolidation Attention Networks for Image
CaptioningLightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time
Image-Text RetrievalZero-shot Image Captioning by Anchor-augmented Vision-Language Space
AlignmentDiscrete-continuous Action Space Policy Gradient-based Attention for
Image-Text MatchingFine-grained Visual Textual Alignment for Cross-Modal Retrieval using
Transformer EncodersMixGen: A New Multi-Modal Data AugmentationCLIP-PING: Boosting Lightweight Vision-Language Models with Proximus
Intrinsic Neighbors GuidanceMore Than Just Attention: Improving Cross-Modal Attentions with
Contrastive Constraints for Image-Text MatchingConstructing Phrase-level Semantic Labels to Form Multi-Grained
Supervision for Image-Text RetrievalVLDeformer: Vision-Language Decomposed Transformer for Fast Cross-Modal
RetrievalImproving Visual Grounding by Encouraging Consistent Gradient-based
ExplanationsPlug-and-Play Regulators for Image-Text MatchingIntra-Modal Constraint Loss For Image-Text RetrievalMuMUR : Multilingual Multimodal Universal RetrievalLearning by Hallucinating: Vision-Language Pre-training with Weak
SupervisionCross-Modal Similarity-Based Curriculum Learning for Image CaptioningVITR: Augmenting Vision Transformers with Relation-Focused Learning for
Cross-Modal Information RetrievalLinear Alignment of Vision-language Models for Image CaptioningTowards reporting bias in visual-language datasets: bimodal augmentation
by decoupling object-attribute associationFeedback-based Modal Mutual Search for Attacking Vision-Language
Pre-training ModelsNearest Neighbor Normalization Improves Multimodal RetrievalLearning Unsupervised Visual Grounding Through Semantic Self-SupervisionLearnable Pillar-based Re-ranking for Image-Text RetrievalTowards Fast and Accurate Image-Text Retrieval with Self-Supervised
Fine-Grained Alignment