Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Nanyun Peng — most-cited papers & profile · Multimodal
← authors
·
overview
Nanyun Peng
26
papers ·
142
citations ·
41
h-index
University of California, Los Angeles · UCLA Health
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone
2022 · 67 citations
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
2024 · 1 citations
Vapr -- Vision-language Preference Alignment For Reasoning
2025
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
2025
ACQUIRED: A Dataset for Answering Counterfactual Questions In Real-Life Videos
2023
Top co-authors
Zi-Yi Dou
· 4
Kai-Wei Chang
· 2
Aishwarya Kamath
· 1
Ce Liu
· 1
Fabrice Harel-Canada
· 1
Fan Yin
· 1
Hritik Bansal
· 1
Jia-Chen Gu
· 1
Jianfeng Gao
· 1
Jianfeng Wang
· 1
Lijuan Wang
· 1
Linjie Li
· 1
Topics
Video-Language
Visual QA & Reasoning
Vision-Language Models
Benchmarks
cs.CV
cs.CL
Image-Text Retrieval
cs.AI