Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Baining Guo — most-cited papers & profile · Multimodal
← authors
·
overview
Baining Guo
26
papers ·
263
citations ·
74
h-index
Microsoft Research Asia (China) · Tsinghua–Berkeley Shenzhen Institute · Southeast University · Tsinghua University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
2025 · 1 citations
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
2025 · 1 citations
MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation
2026
OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation
2025
Top co-authors
Jiaolong Yang
· 3
Qixiu Li
· 3
Heyu Guo
· 2
Huizhi Liang
· 2
Lin Luo
· 2
Ruichun Ma
· 2
Shiqi Jiang
· 2
Sicheng Xu
· 2
Yaobo Liang
· 2
Yu Deng
· 2
Zhiyuan Feng
· 2
Arctanx An
· 1
Topics
Vision-Language Models
Embodied & Agents
Video-Language
Audio-Visual
Benchmarks
Visual QA & Reasoning