Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Hanwang Zhang — most-cited papers & profile · Multimodal
← authors
·
overview
Hanwang Zhang
28
papers ·
6860
citations ·
67
h-index
Nanyang Technological University
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
ChartLlama: A Multimodal LLM for Chart Understanding and Generation
2023 · 25 citations
Grounding Referring Expressions in Images by Variational Context
2017 · 16 citations
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
2023 · 11 citations
Recursive Visual Attention in Visual Dialog
2018 · 5 citations
Causal Attention for Vision-Language Tasks
2021 · 5 citations
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
2025 · 3 citations
Tuning Multi-mode Token-level Prompt Alignment across Modalities
2023 · 2 citations
Unified Generative and Discriminative Training for Multi-modal Large Language Models
2024 · 2 citations
3D Question Answering via only 2D Vision-Language Models
2025 · 1 citations
Auto-Parsing Network for Image Captioning and Visual Question Answering
2021 · 1 citations
Equivariant Similarity for Vision-Language Foundation Models
2023 · 1 citations
Auto-Encoding Morph-Tokens for Multimodal LLM
2024
EMMA: Your Text-to-Image Diffusion Model Can Secretly Accept Multi-Modal Prompts
2024
Top co-authors
Kaihang Pan
· 3
Siliang Tang
· 3
Bin Fu
· 2
Hao Fei
· 2
Jianfei Cai
· 2
Juncheng Li
· 2
Qianru Sun
· 2
Tat-Seng Chua
· 2
Xu Yang
· 2
Yucheng Han
· 2
Yueting Zhuang
· 2
Yulei Niu
· 2
Topics
Vision-Language Models
Visual QA & Reasoning
cs.CV
Video-Language
Benchmarks
Image-Text Retrieval
Audio-Visual
cs.CL
cs.MM