Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Hang Su — most-cited papers & profile · Multimodal
← authors
·
overview
Hang Su
84
papers ·
508
citations ·
28
h-index
Huaqiao University · Jimei University · Tsinghua University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Incorporating External Knowledge to Answer Open-Domain Visual Questions with Dynamic Memory Networks
2017 · 41 citations
LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents
2023 · 6 citations
X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining
2026
SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis
2026
RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization
2026
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
2025
Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering
2025
H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
2025
Top co-authors
Jun Zhu
· 3
Bo Du
· 1
Chunyuan Li
· 1
Feng Li
· 1
Guohao Li
· 1
Hao Cheng
· 1
Haotian Liu
· 1
Hao Wang
· 1
Hao Zhang
· 1
Hui Wang
· 1
Jianfeng Gao
· 1
Jianfeng He
· 1
Topics
Vision-Language Models
Embodied & Agents
Video-Language
Benchmarks
Audio-Visual
Visual QA & Reasoning
Instruction Tuning