Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Xinsong Zhang — most-cited papers & profile · Multimodal
← authors
·
overview
Xinsong Zhang
10
papers ·
28
citations
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Write and Paint: Generative Vision-Language Models are Unified Modal Learners
2022 · 5 citations
X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks
2022 · 5 citations
VLUE: A Multi-Task Benchmark for Evaluating Vision-Language Models
2022 · 4 citations
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
2025
EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning
2022
Top co-authors
Wangchunshu Zhou
· 4
Yan Zeng
· 3
Shizhe Diao
· 2
Hang Li
· 1
Han Hu
· 1
Hu Hu
· 1
Jiawei Wang
· 1
Jiawei Wang
· 1
Jipeng Zhang
· 1
Runquan Xie
· 1
Tiannan Wang
· 1
Xinting Huang
· 1
Topics
Vision-Language Models
Video-Language
Benchmarks
Visual QA & Reasoning
Image-Text Retrieval