Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Yunhang Shen — most-cited papers & profile · Multimodal
← authors
·
overview
Yunhang Shen
11
papers ·
23
citations ·
21
h-index
Zhejiang A & F University · Xiamen University · Tencent (China)
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
2024 · 11 citations
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
2024 · 1 citations
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
2025
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
2024
Top co-authors
Chaoyou Fu
· 4
Mengdan Zhang
· 3
Peixian Chen
· 3
Xiawu Zheng
· 3
Rongrong Ji
· 2
Caifeng Shan
· 1
Caifeng Shan
· 1
Chenyu Zhou
· 1
Chenyu Zhou
· 1
Chi Yan
· 1
Chu Wu
· 1
Deqiang Jiang
· 1
Topics
Visual QA & Reasoning
Vision-Language Models
Benchmarks
Video-Language
cs.CV
Audio-Visual
Image-Text Retrieval