Multi-30K
Emerging13papers using it
2019first seen
The Multi-30K dataset contains image-caption pairs in multiple languages and is used to evaluate multimodal machine translation performance.
Papers using Multi-30K (13)
- Dual-branch Prompting for Multimodal Machine TranslationTowervision: Understanding And Improving Multilinguality In Vision-language ModelsGIIFT: Graph-guided Inductive Image-free Multimodal Machine TranslationImage search using multilingual texts: a cross-modal learning approach
between image and textLightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time
Image-Text RetrievalMultilingual Multimodal Pre-training for Zero-Shot Cross-Lingual
Transfer of Vision-Language ModelsMulti-Head Attention with Diversity for Learning Grounded Multilingual
Multimodal RepresentationsVisual Agreement Regularized Training for Multi-Modal Machine
TranslationMake Imagination Clearer! Stable Diffusion-based Visual Imagination for
Multimodal Machine TranslationMuMUR : Multilingual Multimodal Universal RetrievalCL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual
Knowledge TransferProbing the Need for Visual Context in Multimodal Machine TranslationAligning Multilingual Word Embeddings for Cross-Modal Retrieval Task