Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Xinyue Cai — most-cited papers & profile · Multimodal
← authors
·
overview
Xinyue Cai
4
papers ·
1
citations ·
9
h-index
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
2024 · 1 citations
OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains
2026
Uniugg: Unified 3D Understanding And Generation Via Geometric-semantic Encoding
2025
From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
2025
Top co-authors
Guowei Huang
· 2
Hang Xu
· 2
Jiahui Zhang
· 2
Xingyue Quan
· 2
Yanpeng Zhou
· 2
Yueming Xu
· 2
Yu-Jie Yuan
· 2
Ze Huang
· 2
Caifeng Shan
· 1
Chaoyou Fu
· 1
Gen Luo
· 1
Guannan Jiang
· 1
Topics
Visual QA & Reasoning
Vision-Language Models
Benchmarks
Video-Language
Audio-Visual
Instruction Tuning