Awesome Multimodal
📄
Papers
🧭
Topics
🔥
Trending
🗺️
Map
🏆
Leaderboards
🎓
Learn
🤖
Ask AI
⋯
More
👥
Authors
📚
Reading Packs
📊
Datasets
🛠️
Tools
📰
News
📝
Blogs
✉️
Newsletter
🎯
Research Radar
🔖
Saved
+ Add Paper
☾
☀
← authors
·
overview
Loading author…
🤖
Ask AI
Linjie Li — most-cited papers & profile · Multimodal
← authors
·
overview
Linjie Li
28
papers ·
1662
citations ·
33
h-index
Microsoft Research (United Kingdom)
Google Scholar ↗
Semantic Scholar ↗
OpenAlex ↗
Most-cited papers
Large-Scale Adversarial Training for Vision-and-Language Representation Learning
2020 · 287 citations
UNITER: UNiversal Image-TExt Representation Learning
2019 · 185 citations
Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone
2022 · 67 citations
A Closer Look at the Robustness of Vision-and-Language Pre-trained Models
2020 · 27 citations
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
2023 · 24 citations
Multimodal Foundation Models: From Specialists to General-Purpose Assistants
2023 · 24 citations
UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training
2021 · 7 citations
LightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time Image-Text Retrieval
2021 · 6 citations
MLP Architectures for Vision-and-Language Modeling: An Empirical Study
2021 · 5 citations
LAVENDER: Unifying Video-Language Understanding as Masked Language Modeling
2022 · 2 citations
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
2024 · 2 citations
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
2025 · 1 citations
Equivariant Similarity for Vision-Language Foundation Models
2023 · 1 citations
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
2025
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
2025
Top co-authors
Lijuan Wang
· 7
Zhe Gan
· 7
Zhengyuan Yang
· 6
Jingjing Liu
· 4
Kevin Lin
· 4
Zicheng Liu
· 4
Alex Jinpeng Wang
· 3
Jianfeng Wang
· 3
Mike Zheng Shou
· 3
Shuohang Wang
· 3
Yen-Chun Chen
· 3
Ce Liu
· 2
Topics
Vision-Language Models
Benchmarks
Visual QA & Reasoning
Image-Text Retrieval
Video-Language
Instruction Tuning
Audio-Visual