English
Emerging4papers using it
2024first seen
The 'English' dataset contains image-text pairs used to evaluate the fine-grained visual linguistic abilities of vision language models (VLMs) across various vision-and-language tasks.
Papers using English (4)
- Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful HumorMSA At Imageclef 2025 Multimodal Reasoning: Multilingual Multimodal Reasoning With Ensemble Vision Language ModelsBeyond Content: How Grammatical Gender Shapes Visual Representation In Text-to-image ModelsConstructing Multilingual Visual-Text Datasets Revealing Visual
Multilingual Ability of Vision Language Models