Visual Genome
Canonical16papers using it
2018first seen
Images densely annotated with objects, attributes, relationships, region descriptions, and QA.
Papers using Visual Genome (16)
- PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary TasksGood Scores, Bad Data: A Metric for Multimodal CoherenceInvestigating Spatial Attention Bias in Vision-Language ModelsMultimodal Arabic Captioning With Interpretable Visual Concept IntegrationDynamic Context-aware Scene Reasoning Using Vision-language Alignment In Zero-shot Real-world ScenariosCompositional Image-Text Matching and Retrieval by Grounding EntitiesPixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal
TransformersUNITER: UNiversal Image-TExt Representation LearningEfficient Multi-Modal Embeddings from Structured DataHaVQA: A Dataset for Visual Question Answering and Multimodal Research
in Hausa LanguageDualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large
Language ModelsProgressive Multi-granular Alignments for Grounded Reasoning in Large
Vision-Language ModelsLearning Unsupervised Visual Grounding Through Semantic Self-SupervisionR-VQA: Learning Visual Relation Facts with Semantic Attention for Visual
Question AnsweringViCo: Word Embeddings from Visual Co-occurrencesText-Region Matching for Multi-Label Image Recognition with Missing
Labels