Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Haoyu Cao — most-cited papers & profile · Multimodal
← authors
·
overview
Haoyu Cao
8
papers ·
0
citations ·
10
h-index
University of Science and Technology Liaoning · University of Science and Technology of China · Agro-Environmental Protection Institute · Institute of Environment and Sustainable Development in Agriculture
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
2025
RISE-Video: Can Video Generators Decode Implicit World Rules?
2026
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
2026
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
2026
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
2025
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
2025
Top co-authors
Chaoyou Fu
· 2
Deqiang Jiang
· 2
Di Yin
· 2
Peixian Chen
· 2
Shaoqi Dong
· 2
Xing Sun
· 2
Yi-Fan Zhang
· 2
Bing Liu
· 1
Bo Ke
· 1
Caifeng Shan
· 1
Caifeng Shan
· 1
Chi Yan
· 1
Topics
Vision-Language Models
Video-Language
Benchmarks
Visual QA & Reasoning
Embodied & Agents