Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
B. X. Yu — most-cited papers & profile · Multimodal
← authors
·
overview
B. X. Yu
18
papers ·
26
citations ·
45
h-index
Chinese University of Hong Kong
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
2025 · 1 citations
Visionthink: Smart And Efficient Vision Language Model Via Reinforcement Learning
2025
UniMoCo: Unified Modality Completion for Robust Multi-Modal Embeddings
2025
RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
2025
Towards Versatile and Efficient Visual Knowledge Integration into Pre-trained Language Models with Cross-Modal Adapters
2023
p-Laplacian Adaptation for Generative Pre-trained Vision-Language Models
2023
Top co-authors
Jiaya Jia
· 2
Xinyun Zhang
· 2
Changti Wu
· 1
David Z. Pan
· 1
Hang Yuan
· 1
Han Wu
· 1
Haochen Tan
· 1
Haoyuan Wu
· 1
Hengshuang Zhao
· 1
Jiajun Qin
· 1
Junyi Li
· 1
Kai Chen
· 1
Topics
Vision-Language Models
Video-Language
Visual QA & Reasoning
Benchmarks
Image-Text Retrieval
Audio-Visual
Instruction Tuning