Winoground
Canonical6papers using it
2022first seen
Winoground is a benchmark that evaluates the compositional generalization capabilities of vision-language models by assessing their ability to align directional semantic relations in text with spatial relationships in images.
Papers using Winoground (6)
- Inference-Time Structural Reasoning for Compositional Vision-Language UnderstandingLooking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language ModellingCOCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language ModelsWinoground: Probing Vision and Language Models for Visio-Linguistic
CompositionalityCross-modal Attention Congruence Regularization for Vision-Language
Relation AlignmentPrompting Large Vision-Language Models for Compositional Reasoning