Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Dongxu Li — most-cited papers & profile · Multimodal
← authors
·
overview
Dongxu Li
7
papers ·
2241
citations
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
2023 · 920 citations
BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
2022 · 868 citations
InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning
2023 · 406 citations
Align and Prompt: Video-and-Language Pre-training with Entity Prompts
2021 · 17 citations
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
2023 · 3 citations
Top co-authors
Junnan Li
· 5
Steven Hoi
· 3
Caiming Xiong
· 2
Juan Carlos Niebles
· 2
Silvio Savarese
· 2
Anthony Meng Huat Tiong
· 1
Artemis Panagopoulou
· 1
Boyang Li
· 1
Hongdong Li
· 1
Junqi Zhao
· 1
Le Xue
· 1
Ning Yu
· 1
Topics
Video-Language
Vision-Language Models
Visual QA & Reasoning
Image-Text Retrieval
Instruction Tuning
Audio-Visual
Benchmarks